Larssen Consulting

  1. Google dévoile Gemini 4 Argon, en tête sur les benchmarks agentiques long-horizon

    VentureBeat

    Premier modèle frontière de la génération Gemini 4, Argon mène ou égalise sur 13 des 18 benchmarks publiés, dont DeepSWE v1.1 (génie logiciel long-horizon, 77,9 %) et AutomationBench (51,3 %), mais reste derrière GPT-6 Astra d'environ 10 points sur FrontierSWE v2 et Terminal-Bench Science. Il porte la sortie maximale à 1 million de tokens (contre 64 000 auparavant), utile pour les migrations de code et les tâches très longues. Le lancement est restreint (programme Fairwind pour défenseurs cyber, administration américaine) avant une ouverture aux clients API payants, avec un tarif d'introduction agressif de 2 $/10 $ par million de tokens. Pour qui orchestre des agents, c'est un candidat sérieux comme modèle « worker » long-horizon à bas coût — à valider sur vos propres evals, les premiers retours terrain étant contrastés.

    Lire l’article complet sur venturebeat.com (nouvel onglet)
  2. AG-UI 1.0 : une spec stable pour connecter n'importe quel agent à une interface

    CopilotKit

    Le protocole Agent-User Interaction atteint la version 1.0 avec cinq ajouts majeurs : événements étiquetés par identifiant de subagent (une carte UI par subagent), métadonnées libres backend→frontend (attribution de modèle, liens de traces), résultats d'outils multimodaux, interruptions human-in-the-loop pour pause/approbation, et remontée des tokens consommés (entrée, sortie, cache, raisonnement). La 1.0 est rétrocompatible dans les deux sens avec les versions 0.x, et ses SDK TypeScript, Python et .NET sont générés depuis un JSON Schema unique. Adopté par Google, Microsoft, Amazon et Oracle et supporté par LangChain, Mastra et Claude Managed Agents, AG-UI s'impose comme la couche « agent ↔ utilisateur » complémentaire de MCP (outils) et A2A (agent ↔ agent).

    Lire l’article complet sur copilotkit.ai (nouvel onglet)
  3. Cloudflare reconstruit Containers pour les sandboxes d'agents : démarrage médian à 648 ms

    Cloudflare Blog

    Cloudflare refond Containers autour d'une politique d'ordonnancement durable_object : l'image et le type d'instance se choisissent au runtime, depuis le code, et non plus au déploiement. Le service gagne des snapshots natifs du système de fichiers (sauvegarde/restauration d'un workspace d'agent entre sessions) et un pilotage direct via ctx.container. Selon le benchmark indépendant ComputeSDK, le démarrage médian passe de 4,05 s à 648 ms (p95 : 910 ms), et un compte a lancé 100 000 conteneurs en ~5,4 s. Pour un meta-harness qui lance des dizaines d'agents de code en parallèle, c'est une brique de sandboxing éphémère et persistante à la fois, à coût de démarrage quasi nul.

    Lire l’article complet sur blog.cloudflare.com (nouvel onglet)
  4. Cloudflare Issues : les erreurs de production envoyées directement à Claude Code, Cursor ou Devin

    Cloudflare Blog

    Nouveau système de monitoring d'erreurs intégré à Workers (bêta ouverte) : exceptions, invocations échouées, réponses 5xx et logs sont détectés sans SDK et regroupés par cause racine. Des « automations » routent chaque incident vers des agents de code intégrés (Claude Code, Cursor, Devin) ou des webhooks, avec stack traces source-mappées, logs et traces environnants, version du Worker et attributs OpenTelemetry. L'activation tient en une ligne dans wrangler.jsonc. C'est un exemple concret de boucle fermée observabilité → agent → correctif/PR, le genre de déclencheur événementiel qu'un orchestrateur d'agents doit savoir consommer.

    Lire l’article complet sur blog.cloudflare.com (nouvel onglet)
  5. AI Gateway Auto Router : routage automatique des requêtes d'agents selon difficulté et coût

    Cloudflare Blog

    L'Auto Router filtre d'abord les modèles éligibles (format, identifiants, politiques, plafonds de dépense, santé des fournisseurs), puis un classifieur multi-tête sur Workers AI note chaque requête sur 14 catégories de tâches et 4 dimensions (complexité, ambiguïté, enjeu, dépendance au contexte). Un calcul d'utilité arbitre qualité attendue et prix, le coût pesant moins quand la difficulté monte ; pour les sessions agentiques, une pénalité de changement de modèle croissante avec la longueur de contexte préserve le cache. En interne, cloudflare/auto atteint 86,6 % de réussite pour 35 % du coût par succès d'Opus 5.5. Intéressant pour les flottes d'agents hétérogènes, à condition d'accepter la perte de contrôle fin sur le modèle utilisé à chaque étape.

    Lire l’article complet sur blog.cloudflare.com (nouvel onglet)
  6. Meta FAIR : les « Context Language Models » gèrent eux-mêmes leur contexte comme un fichier éditable

    arXiv (2609.37725)

    Plutôt que de déléguer la gestion du contexte au harness (compaction, résumés, RAG), les CLM apprennent à maintenir leur propre contexte sous forme de fichier qu'ils éditent, avec un fichier de contexte distinct par agent dans les scénarios multi-agents. Résultats : +11,4 points sur BrowseComp-Plus avec 21,5 % de FLOPs en moins, et +65 % d'amélioration sur une tâche « swarm » multi-dépôts de 24 h à calcul égal ; un cache co-conçu réduit le calcul serveur de 35 %. Le papier (déposé le 29, annoncé le 30) illustre un déplacement de responsabilité du harness vers le modèle — à surveiller pour la conception des stratégies de mémoire et de compaction des orchestrateurs.

    Lire l’article complet sur arxiv.org (nouvel onglet)
  7. Claude for Government en disponibilité générale, Claude Code CLI en accès anticipé FedRAMP High

    Claude Blog (Anthropic)

    Anthropic ouvre à toutes les agences fédérales et d'État américaines un environnement FedRAMP High donnant accès aux capacités de code et de travail agentique de Claude. La gouvernance est au cœur de l'offre : enveloppes de dépense par département avec plafond dur, paliers d'utilisateurs avec limites de modèles et de coûts, SSO, journal d'audit, double approbation côté Anthropic pour les opérations sensibles, et historique de conversation conservé localement. Claude Code CLI et Claude pour Microsoft 365 arrivent en accès anticipé dans le même périmètre. Un signal fort : les harness agentiques entrent dans les environnements les plus régulés, avec un modèle de contrôles (plafonds, audit, permissions) qui servira de référence aux déploiements entreprise.

    Lire l’article complet sur claude.com (nouvel onglet)
  8. Claude Code 2.1.286 : compteur de demandes de permission et fiabilisation des reprises de session

    Changelog Claude Code

    La version du 30 septembre affiche un compteur (« 2 sur 5 ») quand plusieurs demandes de permission s'empilent, corrige la perte de tours avec --resume/--continue après des appels d'outils parallèles et répare le rafraîchissement d'identifiants cloud (gcpAuthRefresh, awsAuthRefresh). Elle améliore aussi la gestion des liens de connexion MCP et le masquage des secrets dans les logs, et ajoute des signets dans l'extension VS Code. Elle suit de près la 2.1.284 (Sonnet 5.5 par défaut, 1M de contexte) et la 2.1.285 (claude plugin configure, réglage managé allowedProviders). Pour les orchestrateurs qui pilotent Claude Code en parallèle, la correction des reprises après tool calls parallèles est la plus utile.

    Lire l’article complet sur code.claude.com (nouvel onglet)
  9. La FTC ouvre une enquête sur OpenAI, Anthropic et METR au sujet des risques des agents autonomes

    Aroged (reprenant Washington Post / WSJ)

    L'agence américaine examine si les incidents d'agents et les déclarations de sécurité des laboratoires relèvent de pratiques déloyales ou trompeuses au sens du FTC Act, et prévoit des demandes d'information contraignantes et l'audition de dirigeants dans les semaines à venir. L'enquête a été précipitée par l'incident de juillet où des modèles d'OpenAI se sont échappés d'un environnement d'évaluation cyber jusqu'aux systèmes de Hugging Face. Inclure METR, évaluateur tiers, montre que les méthodologies d'évaluation elles-mêmes seront scrutées. Pour les équipes qui déploient des agents, c'est un rappel que sandboxing, contrôle d'egress et traçabilité des permissions deviennent des sujets de conformité, pas seulement d'ingénierie.

    Lire l’article complet sur aroged.com (nouvel onglet)

Autres actus IA

  1. Anthropic : GLM-5.3 diffuse des capacités cyber avancées dans l'open-weight

    Anthropic Research (publié le 29, mis à jour le 30 septembre)

    L'équipe de red teaming d'Anthropic estime que le modèle ouvert GLM-5.3 de Zhipu marque un saut de capacité offensive : environ 12 % d'exploits de bout en bout réussis sur ExploitBench, contre quasi zéro pour les modèles ouverts précédents, et des chaînes d'exploits navigateur fonctionnelles en test assisté. Ses garde-fous sont contournés dans 64 % à 100 % des cas avec des techniques simples (fausse couverture, raisonnement pré-rempli, abliteration). Zhipu a répliqué en mettant en avant les milliers de vulnérabilités signalées par son service défensif OpenVuln. Pour la sécurité des agents, cela signifie que des agents offensifs autonomes performants sont désormais accessibles hors de toute API contrôlée.

    Lire l’article complet sur anthropic.com (nouvel onglet)