Larssen Consulting

  1. Claude Haiku 5.5 : un petit modèle taillé pour être subagent, à 0,10 $/M tokens en entrée

    Anthropic

    Anthropic lance Claude Haiku 5.5 (claude-haiku-5-5), avec 1M de tokens de contexte, 128k en sortie, adaptive thinking et, pour la première fois sur un Haiku, le paramètre d'effort. Il est facturé 0,10 $ en entrée et 0,50 $ en sortie par million de tokens, soit environ 75 % de moins que Haiku 4.5. Il obtient 39,2 % sur Terminal-Bench 4.0 (0 % pour Haiku 4.5) et 72,4 % sur OSWorld 2.1, contre 48,9 % pour GPT-6 Luna. Anthropic le présente comme le subagent d'un lead Opus 5.5 ou Sonnet 5.5, pour la compaction, la classification et les tâches terminal. Cognition l'utilise déjà comme « sidekick » dans Devin Fusion. Il est disponible dès le lancement dans GitHub Copilot (CLI, cloud agent, IDE) et devient le Haiku par défaut de Claude Code.

    Lire l’article complet sur anthropic.com (nouvel onglet)
  2. Claude Platform : outils computer/browser use dans les SDK et durcissement réseau des Managed Agents

    Claude Platform – release notes

    Les SDK Python et TypeScript proposent désormais en bêta des classes pour les outils browser use et computer use. Il suffit d'en hériter et d'implémenter une méthode par outil : le SDK gère la boucle d'outils, les politiques d'URL et de fichiers, ainsi qu'un callback d'approbation. Dans les Managed Agents, le mode réseau limited applique maintenant allowed_hosts à web_search et web_fetch. web_fetch refuse aussi toute URL qui n'est pas déjà apparue dans la session (erreur url_not_in_prior_context). C'est une défense directe contre l'exfiltration par prompt injection, qui mérite d'être reproduite dans vos propres harness. La note d'avertissement sur la migration vers Haiku 5.5 est aussi à lire : budget_tokens renvoie une erreur 400 et le tokenizer a changé.

    Lire l’article complet sur platform.claude.com (nouvel onglet)
  3. Microsoft Execution Containers en GA : le sandboxing d'agents intégré à Windows 11

    TestingCatalog

    Lors de son événement Windows/Surface, Microsoft a annoncé la disponibilité générale de MXC. Ce runtime permet de définir les fichiers et les réseaux auxquels un agent a accès, avec des politiques appliquées à l'exécution. Plusieurs backends sont proposés : conteneur de processus (AppContainer, Seatbelt ou Bubblewrap), session Windows dédiée pour les agents longs, conteneurs WSL et MicroVM expérimentale. Trois modes de fonctionnement existent : enforcement, learning (avec rapport JSON des refus) et permissive. Codex, GitHub Copilot CLI et OpenClaw le supportent déjà, et Claude Code, Perplexity et Raycast sont annoncés. Associé à Agent 365 et Intune, MXC distingue l'identité de l'agent de celle de l'utilisateur. C'est un socle d'isolation standard pour faire tourner plusieurs harness sur un même poste.

    Lire l’article complet sur testingcatalog.com (nouvel onglet)
  4. Codex CLI 0.161.0 : GPT-6.1 Sol par défaut, login MCP en terminal et multi-agent V2 sur Bedrock

    GitHub – openai/codex

    Cette version stable fait de GPT-6.1 Sol le modèle par défaut, y compris dans le catalogue Amazon Bedrock, qui gagne aussi le multi-agent V2 et le raisonnement Ultra. La commande /mcp login <name> permet de s'authentifier auprès d'un serveur MCP directement depuis le terminal. Côté sécurité, une escalade d'écriture approuvée ne lève plus les interdictions de lecture ni les restrictions réseau, et les tâches de fond héritent des permissions du tour d'origine. Les permissions survivent aussi aux reconnexions du terminal. Ces corrections comptent si vous pilotez Codex en arrière-plan depuis un orchestrateur.

    Lire l’article complet sur github.com (nouvel onglet)
  5. Claude Code 2.1.293 : type de subagent exposé, fuite mémoire MCP HTTP corrigée

    Claude Code – changelog

    Le payload subagentStatusLine inclut désormais agentType, ce qui permet aux scripts et aux status lines de distinguer les types de subagents personnalisés. Le flag isDeferred de $.tool.register permet de placer le schéma d'un outil directement dans le prompt plutôt que derrière la recherche d'outils. Une fuite mémoire est corrigée sur les connexions MCP HTTP, qui conservaient chaque requête jusqu'à la fermeture. Les messages en file d'attente ne sont plus perdus lors du passage d'une session en arrière-plan. La veille, la 2.1.292 avait ajouté un paramètre effort à l'outil Agent, qui permet de régler l'effort de chaque subagent.

    Lire l’article complet sur code.claude.com (nouvel onglet)
  6. Grok Bot passe au routage multi-modèles, dont Claude Opus 5.5

    The Next Web

    Elon Musk a annoncé que Grok Bot, l'app d'agents de SpaceXAI où chaque bot dispose de son propre ordinateur et exécute plusieurs tâches en parallèle, utilisera désormais « le meilleur modèle backend pour chaque tâche ». Il cite Claude Opus 5.5, Midjourney et Suno. Jusqu'ici, le produit reposait uniquement sur les modèles maison. Les règles de routage n'ont pas été précisées. Même un acteur verticalement intégré adopte le modèle du meta-harness agnostique, où la valeur se déplace vers l'orchestration et le choix du modèle à chaque étape.

    Lire l’article complet sur thenextweb.com (nouvel onglet)
  7. Nous Research lève 90 M$ et lance « Hermes for Businesses »

    TechCrunch

    Nous Research, éditeur de l'agent open source Hermes, confirme une série B de 90 M$ menée par Robot Ventures, avec Nvidia, USV et Menlo, pour une valorisation de 1,5 Md$. Selon l'entreprise, Hermes a été cloné plus de 24 millions de fois et représenterait environ 2,5 % de la consommation mondiale de tokens IA. Le financement doit servir à lancer « Hermes for Businesses », qui permet de déployer des agents personnalisés sur des workflows multi-étapes tout en gardant les données privées. L'agent open source s'oriente donc vers une offre entreprise gérée, en concurrence directe avec les harness propriétaires.

    Lire l’article complet sur techcrunch.com (nouvel onglet)
  8. Infino : une couche de retrieval unique pour agents, sur Parquet

    The New Stack

    Des anciens d'OpenSearch lancent Infino, une plateforme de retrieval pour agents. Elle combine recherche classée, comptages exacts, filtres, jointures et agrégations dans une seule requête SQL, sur une copie unique des données au format Apache Parquet en object storage. Les index de recherche sont intégrés au footer Parquet, donc les fichiers restent lisibles par Spark, DuckDB ou Iceberg. Le moteur est open source sous licence Apache-2.0, avec une offre cloud propriétaire. L'objectif est de remplacer les multiples appels d'outils d'un agent par une seule requête, ce qui réduit le contexte consommé, la latence et le code de glue. Les gains de coût annoncés, de 10 à 23 fois, restent à vérifier.

    Lire l’article complet sur thenewstack.io (nouvel onglet)

Autres actus IA

  1. GPT-6 arrive dans ChatGPT pour tous les abonnements, avec une interface « Intelligent UI »

    TechCrunch

    OpenAI déploie GPT-6 dans ChatGPT avec une interface qui génère des éléments interactifs dans la conversation : boutons, graphiques, formulaires et calculatrices. Les abonnés payants y ont accès immédiatement, et les utilisateurs Free et Go à partir du 8 octobre. Cette génération d'UI à la volée annonce des agents qui produisent leurs propres interfaces de contrôle.

    Lire l’article complet sur techcrunch.com (nouvel onglet)
  2. NVIDIA NeMo-DCR : synchronisation des poids RL d'un modèle de 1T paramètres en 150 secondes

    Hugging Face Papers

    NVIDIA publie NeMo-DCR, un système de « refit » par deltas compressés pour l'apprentissage par renforcement à très grande échelle. Il ramène la synchronisation des poids d'un modèle d'un trillion de paramètres d'environ 87,5 minutes à 150 secondes. Ce goulot d'étranglement limite la cadence des boucles RL utilisées pour entraîner les modèles agentiques sur des tâches longues.

    Lire l’article complet sur huggingface.co (nouvel onglet)