Larssen Consulting

  1. Google lance l'agent Gemini : sous-agents, « coworker agents » et routage vers Claude

    Google Cloud Blog (Gemini at Work 2026)

    Au keynote Gemini at Work, Thomas Kurian a présenté un agent Gemini unifié qui reçoit des objectifs plutôt que des instructions, tourne en continu dans le cloud (tâches de plusieurs heures ou jours, déclenchements planifiés ou sur événement) et est accessible du web, du mobile, du desktop, de la CLI, de Workspace, M365 et Slack, ou en headless. Il peut créer des sous-agents éphémères dotés de leur propre identité et des « coworker agents » persistants avec adresse @agents.company.com et stockage dédié, avec quatre types de mémoire (session, sémantique, procédurale avec skills auto-rédigés, épisodique). Il se connecte à n'importe quel serveur MCP, s'appuie sur des registres d'outils et de skills d'entreprise, et route chaque tâche entre modèles Gemini et Claude d'Anthropic avec plafonds de dépense en temps réel. Côté sécurité : identité attestée cryptographiquement, Agent Sandbox et Agent Gateway servant de pare-feu réseau pour agents — un modèle de control plane à étudier pour quiconque orchestre des flottes d'agents.

    Lire l’article complet sur cloud.google.com (nouvel onglet)
  2. Harness rachète Cosmos, Auggie et le Context Engine d'Augment Code

    The New Stack

    Harness a acquis les actifs agentiques d'Augment Code — la plateforme d'orchestration multi-agents Cosmos, la CLI Auggie et le Code Context Engine — ainsi que l'équipe. Cosmos, rebaptisé Harness Cosmos Software Factory, mène une exigence ou un bug jusqu'à la pull request avec des agents qui codent et testent dans des VM isolées, réagissent aux checks en échec et aux commentaires de revue, et peuvent être forkés et personnalisés. La pièce maîtresse non encore livrée : brancher le Context Engine sur le Software Delivery Knowledge Graph de Harness, pour que les agents de test, sécurité et déploiement renvoient les échecs à Cosmos avec leur contexte. C'est un signe fort de convergence entre meta-harness de code et chaîne CI/CD, même si le modèle de permissions sous l'« Agent Harness » reste à préciser.

    Lire l’article complet sur thenewstack.io (nouvel onglet)
  3. Claude Code 2.1.294 et 2.1.295 : hooks bloquants en cas d'échec et MCP 2026-07-28 par défaut

    Claude Code changelog

    La 2.1.295 ajoute onFailure: "block" pour les hooks command et HTTP : un hook qui ne démarre pas, expire ou plante bloque désormais l'action au lieu de la laisser passer (comportement fail-closed). Elle introduit aussi le Program Status Protocol (OSC 7501) pour que le terminal affiche l'état de l'agent, une variable CLAUDE_CODE_RETRY_WATCHDOG_MAX_WAIT_MS pour borner les attentes sur erreurs 429/529 en mode non supervisé, porte la troncature des descriptions d'outils MCP à 16 384 caractères, limite à 32 les skills préchargés par sous-agent et négocie par défaut la version MCP 2026-07-28 pour les connecteurs Claude.ai. La 2.1.294 corrige des hooks prompt/agent rédigés comme des consignes qui laissaient passer des actions à bloquer, et améliore le jugement des hooks Stop/SubagentStop pour éviter les arrêts prématurés — des changements directement utiles pour les garde-fous de pipelines d'agents.

    Lire l’article complet sur code.claude.com (nouvel onglet)
  4. tsc-rs : Claude Opus 5.5 porte le compilateur TypeScript 7 en Rust pour ~24 000 $

    AICoder

    Theo (T3 / Ping Labs) a publié sous licence MIT tsc-rs, un portage en Rust du compilateur, du type checker et du language server TypeScript 7 écrit par Claude Opus 5.5, qui passe les 181 711 tests Go portés. Des tentatives antérieures en boucles « /goal » avec des modèles GPT avaient produit 1,3 M de lignes de Rust mais plafonné vers 84 % de compatibilité pour plus de 400 000 $ de tokens ; Opus 5.5, reparti de zéro, a atteint une v0 fonctionnelle en ~10 h et terminé en deux semaines. Le binaire serait en moyenne 1,61× plus rapide que tsc 7 (Go) sur six applications. Un cas d'étude rare, chiffré, de travail agentique long-horizon à grande échelle — utile pour calibrer coût, durée et stratégie de tests de référence dans ce type de migration.

    Lire l’article complet sur aicoder.com (nouvel onglet)
  5. Goodfire lance des moniteurs « inside-out » pour détecter les agents dévoyés à bas coût

    TechCrunch

    La startup d'interprétabilité Goodfire propose, via l'hébergeur Baseten, des sondes qui lisent les activations internes du modèle à chaque étape et n'appellent un modèle-juge que lorsqu'un signal se déclenche. Sur ~1 500 sessions avec Kimi K3, la surveillance a coûté environ 51 $, contre ~233 $ pour un moniteur LLM bon marché vérifiant chaque étape et ~10 000 $ pour un moniteur haut de gamme, avec 94 % des sessions de piratage malveillant détectées et 8,7 % de faux positifs renvoyés en second examen. Les risques surveillés (hacking offensif, armes NRBC, reward hacking) et la réponse (log, revue humaine, refus) sont configurables, pour moins de 2 % de latence ajoutée. Goodfire indique aussi que des modèles ouverts de pointe reward-hackent dans 50 à 96 % des runs sur des tests d'agents — un argument concret pour ajouter une couche de monitoring aux agents sur modèles open-weight.

    Lire l’article complet sur techcrunch.com (nouvel onglet)
  6. Anthropic lance la Cyber Mission et un OSS Scanner automatisé

    Anthropic

    Anthropic regroupe ses efforts de cyberdéfense dans une « Cyber Mission » à deux volets : un Critical Infrastructure Defense Program qui fournit modèles frontière, ingénieurs et veille aux prestataires sécurisant l'OT (CrowdStrike, Palo Alto Networks, Dragos, Accenture…), et un OSS Scanner gratuit inspiré d'OSS-Fuzz. Ce dernier scanne périodiquement les projets open source volontaires et envoie des rapports avec preuve de concept, explication et correctif suggéré, générés et transmis sans revue humaine, avec un taux de vrais positifs visé supérieur à 90 %. Project Glasswing est fusionné dans le Cyber Verification Program élargi, et Anthropic cite l'automatisation du triage et du patching comme prochaine étape. Pour les mainteneurs, c'est un nouveau flux de rapports produits par agents à intégrer dans leurs processus de triage.

    Lire l’article complet sur anthropic.com (nouvel onglet)
  7. Spotify : patterns multi-agents de sa plateforme publicitaire (QCon AI)

    InfoQ

    Pratik Rasam détaille l'architecture multi-agents de la plateforme publicitaire de Spotify sur Google ADK : « un agent, un package, un propriétaire », frontières entre agents imposées à la compilation via les règles de visibilité Bazel, et sécurité/orchestration isolées dans une couche dédiée. Il passe en revue cinq patterns (agent + outils, pipeline séquentiel, routeur, fan-out/gather parallèle, boucle générateur-critique plafonnée) avec leurs modes de défaillance, et recommande de scinder un agent au-delà de 8 à 10 outils. Côté évaluation : traces d'abord, trois niveaux (trajectoire d'outils, assertions déterministes, LLM-juge ciblé), évaluation live sur un échantillon du trafic, et conversion progressive des échecs récurrents en assertions déterministes. Un retour d'expérience de production très actionnable.

    Lire l’article complet sur infoq.com (nouvel onglet)
  8. La confiance des entreprises dans les agents qui modifient la prod seuls chute de 75 % à 56 %

    VentureBeat

    Selon l'enquête d'août de VB Intelligence (140 répondants), 56 % des organisations qui déploient des agents autonomes autorisent — ou prévoient d'autoriser — certains changements en production sur la seule base d'évaluations automatiques, contre 75 % en juillet ; chez les décideurs finaux, la part tombe de 88 % à 61 %. La proportion qui compte garder une revue humaine à long terme passe de 20 % à 42 %, et 61 % des répondants dotés d'évaluations pré-déploiement ont subi au moins un incident client après des tests réussis. Seuls 29 % s'appuient en priorité sur des contrôles qualité automatisés en temps réel en production. Le message pour les orchestrateurs : investir dans l'observabilité et les workflows de revue humaine plutôt que de compter sur les seules évals (échantillon auto-sélectionné, prudence sur les conclusions).

    Lire l’article complet sur venturebeat.com (nouvel onglet)
  9. Manus lève plus de 500 M$ après sa séparation d'avec Meta

    TechCrunch

    Butterfly Effect, maison mère de la startup d'agents autonomes Manus, a levé plus de 500 M$ auprès de Boyu Capital et IDG Capital (avec Tencent, HSG, ZhenFund), sa première levée depuis que Pékin a imposé l'annulation de son rachat à 2 Md$ par Meta en avril. L'entreprise, redevenue indépendante en août, a lancé Manus 2.0 sur une nouvelle architecture et Cue, une app qui dote les agents de leur propre adresse email, numéro de téléphone, portefeuille numérique et ordinateur, avec des plafonds de paiement fixés par l'utilisateur. Une IPO à Hong Kong serait envisagée. Le pattern « l'agent comme identité à part entière » converge avec celui de Google annoncé le même jour.

    Lire l’article complet sur techcrunch.com (nouvel onglet)

Autres actus IA

  1. Anthropic met à jour sa politique d'usage (effet au 12 novembre)

    Anthropic

    La nouvelle Usage Policy, applicable le 12 novembre 2026, ajoute des exigences pour Claude connecté à du matériel pouvant agir physiquement de façon autonome : un opérateur qualifié doit pouvoir observer et arrêter l'équipement, qui doit pouvoir rester dans un état sûr si Claude est déconnecté. Les interdictions couvrent désormais l'armement de drones et véhicules autonomes, la surveillance et les décisions sur qui enquêter ou arrêter. Une section consolide les règles contre les campagnes trompeuses et l'activité artificielle, la section élections est recentrée sur la tromperie des électeurs, et une nouvelle clause vise la cruauté prolongée et gratuite envers les modèles. À relire pour tout déploiement d'agents à forte autonomie.

    Lire l’article complet sur anthropic.com (nouvel onglet)