Tendances du jour
Le « petit modèle exécutant » devient une brique d'architecture à part entière : Haiku 5.5 casse les prix et vise explicitement le rôle de subagent sous un orchestrateur Opus/Sonnet. En parallèle, l'isolation et le contrôle des agents passent au niveau de l'OS (Microsoft Execution Containers en GA) et des plateformes (restrictions réseau des Managed Agents). Côté produits, le routage multi-modèles s'impose, jusque chez Grok Bot.
Claude Haiku 5.5 : un petit modèle taillé pour être subagent, à 0,10 $/M tokens en entrée
Anthropic
Anthropic lance Claude Haiku 5.5 (claude-haiku-5-5), avec 1M de tokens de contexte, 128k en sortie, adaptive thinking et, pour la première fois sur un Haiku, le paramètre d'effort. Il est facturé 0,10 $ en entrée et 0,50 $ en sortie par million de tokens, soit environ 75 % de moins que Haiku 4.5. Il obtient 39,2 % sur Terminal-Bench 4.0 (0 % pour Haiku 4.5) et 72,4 % sur OSWorld 2.1, contre 48,9 % pour GPT-6 Luna. Anthropic le présente comme le subagent d'un lead Opus 5.5 ou Sonnet 5.5, pour la compaction, la classification et les tâches terminal. Cognition l'utilise déjà comme « sidekick » dans Devin Fusion. Il est disponible dès le lancement dans GitHub Copilot (CLI, cloud agent, IDE) et devient le Haiku par défaut de Claude Code.
Lire l’article complet sur anthropic.com (nouvel onglet)Claude Platform : outils computer/browser use dans les SDK et durcissement réseau des Managed Agents
Claude Platform – release notes
Les SDK Python et TypeScript proposent désormais en bêta des classes pour les outils browser use et computer use. Il suffit d'en hériter et d'implémenter une méthode par outil : le SDK gère la boucle d'outils, les politiques d'URL et de fichiers, ainsi qu'un callback d'approbation. Dans les Managed Agents, le mode réseau limited applique maintenant allowed_hosts à web_search et web_fetch. web_fetch refuse aussi toute URL qui n'est pas déjà apparue dans la session (erreur url_not_in_prior_context). C'est une défense directe contre l'exfiltration par prompt injection, qui mérite d'être reproduite dans vos propres harness. La note d'avertissement sur la migration vers Haiku 5.5 est aussi à lire : budget_tokens renvoie une erreur 400 et le tokenizer a changé.
Lire l’article complet sur platform.claude.com (nouvel onglet)Microsoft Execution Containers en GA : le sandboxing d'agents intégré à Windows 11
TestingCatalog
Lors de son événement Windows/Surface, Microsoft a annoncé la disponibilité générale de MXC. Ce runtime permet de définir les fichiers et les réseaux auxquels un agent a accès, avec des politiques appliquées à l'exécution. Plusieurs backends sont proposés : conteneur de processus (AppContainer, Seatbelt ou Bubblewrap), session Windows dédiée pour les agents longs, conteneurs WSL et MicroVM expérimentale. Trois modes de fonctionnement existent : enforcement, learning (avec rapport JSON des refus) et permissive. Codex, GitHub Copilot CLI et OpenClaw le supportent déjà, et Claude Code, Perplexity et Raycast sont annoncés. Associé à Agent 365 et Intune, MXC distingue l'identité de l'agent de celle de l'utilisateur. C'est un socle d'isolation standard pour faire tourner plusieurs harness sur un même poste.
Lire l’article complet sur testingcatalog.com (nouvel onglet)Codex CLI 0.161.0 : GPT-6.1 Sol par défaut, login MCP en terminal et multi-agent V2 sur Bedrock
GitHub – openai/codex
Cette version stable fait de GPT-6.1 Sol le modèle par défaut, y compris dans le catalogue Amazon Bedrock, qui gagne aussi le multi-agent V2 et le raisonnement Ultra. La commande /mcp login <name> permet de s'authentifier auprès d'un serveur MCP directement depuis le terminal. Côté sécurité, une escalade d'écriture approuvée ne lève plus les interdictions de lecture ni les restrictions réseau, et les tâches de fond héritent des permissions du tour d'origine. Les permissions survivent aussi aux reconnexions du terminal. Ces corrections comptent si vous pilotez Codex en arrière-plan depuis un orchestrateur.
Lire l’article complet sur github.com (nouvel onglet)Claude Code 2.1.293 : type de subagent exposé, fuite mémoire MCP HTTP corrigée
Claude Code – changelog
Le payload subagentStatusLine inclut désormais agentType, ce qui permet aux scripts et aux status lines de distinguer les types de subagents personnalisés. Le flag isDeferred de $.tool.register permet de placer le schéma d'un outil directement dans le prompt plutôt que derrière la recherche d'outils. Une fuite mémoire est corrigée sur les connexions MCP HTTP, qui conservaient chaque requête jusqu'à la fermeture. Les messages en file d'attente ne sont plus perdus lors du passage d'une session en arrière-plan. La veille, la 2.1.292 avait ajouté un paramètre effort à l'outil Agent, qui permet de régler l'effort de chaque subagent.
Lire l’article complet sur code.claude.com (nouvel onglet)Grok Bot passe au routage multi-modèles, dont Claude Opus 5.5
The Next Web
Elon Musk a annoncé que Grok Bot, l'app d'agents de SpaceXAI où chaque bot dispose de son propre ordinateur et exécute plusieurs tâches en parallèle, utilisera désormais « le meilleur modèle backend pour chaque tâche ». Il cite Claude Opus 5.5, Midjourney et Suno. Jusqu'ici, le produit reposait uniquement sur les modèles maison. Les règles de routage n'ont pas été précisées. Même un acteur verticalement intégré adopte le modèle du meta-harness agnostique, où la valeur se déplace vers l'orchestration et le choix du modèle à chaque étape.
Lire l’article complet sur thenextweb.com (nouvel onglet)Nous Research lève 90 M$ et lance « Hermes for Businesses »
TechCrunch
Nous Research, éditeur de l'agent open source Hermes, confirme une série B de 90 M$ menée par Robot Ventures, avec Nvidia, USV et Menlo, pour une valorisation de 1,5 Md$. Selon l'entreprise, Hermes a été cloné plus de 24 millions de fois et représenterait environ 2,5 % de la consommation mondiale de tokens IA. Le financement doit servir à lancer « Hermes for Businesses », qui permet de déployer des agents personnalisés sur des workflows multi-étapes tout en gardant les données privées. L'agent open source s'oriente donc vers une offre entreprise gérée, en concurrence directe avec les harness propriétaires.
Lire l’article complet sur techcrunch.com (nouvel onglet)Infino : une couche de retrieval unique pour agents, sur Parquet
The New Stack
Des anciens d'OpenSearch lancent Infino, une plateforme de retrieval pour agents. Elle combine recherche classée, comptages exacts, filtres, jointures et agrégations dans une seule requête SQL, sur une copie unique des données au format Apache Parquet en object storage. Les index de recherche sont intégrés au footer Parquet, donc les fichiers restent lisibles par Spark, DuckDB ou Iceberg. Le moteur est open source sous licence Apache-2.0, avec une offre cloud propriétaire. L'objectif est de remplacer les multiples appels d'outils d'un agent par une seule requête, ce qui réduit le contexte consommé, la latence et le code de glue. Les gains de coût annoncés, de 10 à 23 fois, restent à vérifier.
Lire l’article complet sur thenewstack.io (nouvel onglet)
Autres actus IA
GPT-6 arrive dans ChatGPT pour tous les abonnements, avec une interface « Intelligent UI »
TechCrunch
OpenAI déploie GPT-6 dans ChatGPT avec une interface qui génère des éléments interactifs dans la conversation : boutons, graphiques, formulaires et calculatrices. Les abonnés payants y ont accès immédiatement, et les utilisateurs Free et Go à partir du 8 octobre. Cette génération d'UI à la volée annonce des agents qui produisent leurs propres interfaces de contrôle.
Lire l’article complet sur techcrunch.com (nouvel onglet)NVIDIA NeMo-DCR : synchronisation des poids RL d'un modèle de 1T paramètres en 150 secondes
Hugging Face Papers
NVIDIA publie NeMo-DCR, un système de « refit » par deltas compressés pour l'apprentissage par renforcement à très grande échelle. Il ramène la synchronisation des poids d'un modèle d'un trillion de paramètres d'environ 87,5 minutes à 150 secondes. Ce goulot d'étranglement limite la cadence des boucles RL utilisées pour entraîner les modèles agentiques sur des tâches longues.
Lire l’article complet sur huggingface.co (nouvel onglet)