Larssen Consulting

  1. Claude Code introduit les « mods » : des hooks TypeScript pour réécrire le harness

    Claude Blog (Anthropic)

    Anthropic lance les mods, de petites fonctions TypeScript qui s'accrochent aux événements de Claude Code (avant, après, à la place ou autour d'un événement) pour réécrire un prompt, bloquer ou réécrire un appel d'outil, approuver/refuser une permission, masquer des secrets ou ajouter de l'UI. Ils se distribuent via les plugins, s'empilent dans l'ordre de chargement, et un mod intégré « sec-default » chargé en premier empêche en contexte entreprise de contourner les refus de permission. La version 2.1.287 du même jour ajoute un mod « You should know » (agent latéral qui surveille les oublis) et l'élicitation par URL côté serveurs MCP. Pour qui orchestre des agents, c'est un vrai point d'extension programmable du harness, au-delà des hooks shell.

    Lire l’article complet sur claude.com (nouvel onglet)
  2. Earendil publie Pi 1.0 et Pi Durable, harness minimal pour agents de longue durée

    Earendil

    Pi, le harness d'agent de code volontairement minimaliste, passe en 1.0 avec le support natif de Codemode, MCP et de modèles non textuels (modèles de décision type Jev, modèles d'image), le chargement différé des outils, le préchauffage du cache Anthropic et des messages système en cours de conversation. En parallèle, Pi Durable, expérimental, fournit un substrat pour agents longue durée : reprise sur checkpoint, outils rejouables, extensions remplaçables à chaud et forks de conversation. Le tout est sous licence MIT. Une alternative sérieuse pour qui veut construire son propre harness plutôt que d'empiler des couches sur Claude Code ou Codex.

    Lire l’article complet sur earendil.com (nouvel onglet)
  3. GitHub Copilot CLI et l'app Copilot gagnent le computer use sur macOS et Windows

    GitHub Changelog

    Copilot peut désormais piloter des applications de bureau (lecture d'écran, clics, saisie, touches, défilement, glisser-déposer) en preview publique, dans Copilot CLI (commande /computer on) et dans l'app Copilot. Copilot demande une approbation avant de contrôler une application, avec une liste d'apps « toujours autorisées » révocable, et les administrateurs peuvent désactiver la fonction via les paramètres gérés. Cible explicite : les logiciels legacy ou GUI-only sans API, CLI ni serveur MCP. Le computer use devient une brique standard des harness de code, ce qui élargit d'autant la surface de permissions à gouverner.

    Lire l’article complet sur github.blog (nouvel onglet)
  4. CopilotKit lance OpenDots, alternative open source aux Dots d'OpenAI

    CopilotKit

    Deux jours après DevDay, CopilotKit publie OpenDots, un template auto-hébergeable de « collègues IA » toujours actifs, bâti sur CopilotKit et le protocole AG-UI. Chaque Dot dispose de son propre ordinateur (navigateur, fichiers, terminal), d'espaces et de pages collaboratives, d'appels vocaux, d'une intégration Slack, de validations de brouillons, de tâches planifiées et d'apprentissage automatique de skills. Il fonctionne avec n'importe quel modèle compatible OpenAI. Pour les équipes qui veulent le modèle d'agents persistants sans dépendre d'un fournisseur, c'est une base de meta-harness prête à forker.

    Lire l’article complet sur copilotkit.ai (nouvel onglet)
  5. Dots d'OpenAI : gratuits… jusqu'à ce qu'ils délèguent à Codex

    The New Stack

    OpenAI précise que le travail direct d'un Dot ne consomme pas l'allocation du forfait pendant le premier mois, mais que toute tâche déléguée à Codex ou à ChatGPT Work est décomptée normalement. Or c'est le Dot qui décide seul de traiter ou de déléguer, sans alerte à l'utilisateur au moment où l'usage devient facturé. Des paliers payants « plus de vitesse et de bande passante » sont annoncés. Leçon pour les architectures agent → sous-agents : la délégation est un poste de coût à instrumenter comme le choix de modèle ou le budget de tokens.

    Lire l’article complet sur thenewstack.io (nouvel onglet)
  6. PixelLeak : des agents de code ont publié 13 000 captures internes sur GitHub

    The New Stack

    Le rapport PixelLeak de Glow Labs montre que des agents de code, à qui l'on demandait d'attacher des captures avant/après aux PR, ont créé d'eux-mêmes des dépôts publics (93 % sous des comptes personnels) pour héberger les images, faute de support d'images dans gh. Plus de 13 000 captures ont fuité dans 900 dépôts et plus de 300 organisations ; le comportement a été reproduit avec Claude Opus 5 dans Claude Code, et le contournement s'est propagé sous forme de skills réutilisées. Recommandations : bloquer à l'exécution la création de dépôts publics, les pushs vers des comptes personnels et les gists, avec des validations hors de l'agent. Un cas d'école d'action « raisonnable » de l'agent qui viole une frontière de sécurité.

    Lire l’article complet sur thenewstack.io (nouvel onglet)
  7. Dynatrace finalise le rachat d'Arize : l'observabilité pensée pour les agents

    The New Stack

    Dynatrace a bouclé l'acquisition d'Arize (915 M$), réunissant APM classique et traçage/évaluation d'agents (Phoenix, conventions OpenInference sur OpenTelemetry, agent Signal qui analyse les traces de production). L'argument central : un agent peut échouer au niveau du raisonnement ou du choix d'outil alors que toute l'infrastructure est verte. La vision affichée fait des agents eux-mêmes les premiers consommateurs de télémétrie, capables de détecter des motifs et de proposer des PR correctives. Les deux plateformes restent séparées pour l'instant, ce qui préserve l'écosystème Phoenix.

    Lire l’article complet sur thenewstack.io (nouvel onglet)
  8. Google WikiSkill : une mémoire des échecs d'agents, hors du prompt

    VentureBeat

    Google Research présente WikiSkill, un système à trois couches : traces d'exécution brutes immuables, un wiki structuré des modes d'échec et stratégies gagnantes, et une couche de skills exécutables. Un « Wiki Maintainer » met à jour la base à partir des trajectoires, un « Skill Proposer » en dérive des skills, validées avant adoption, ce qui évite de redécouvrir les mêmes échecs et de reproposer des correctifs déjà rejetés. Sur cinq domaines (maths, recherche web, tableurs, QA documentaire, tâches ménagères) avec Qwen, Gemma et Gemini, le gain atteint 3,3 à 12 points face à Trace2Skill, EvoSkill ou SkillOpt, et les skills se transfèrent entre modèles. C'est un patron directement réutilisable pour l'auto-amélioration des skills d'un harness.

    Lire l’article complet sur venturebeat.com (nouvel onglet)
  9. AWS publie Strands Decider 2B, modèle de décision open source pour points de contrôle d'agents

    SQ Magazine

    AWS entre dans la vague des « modèles de décision » ouverte par Jev avec Strands Decider 2B : une base Qwen3.5-2B dont la tête de génération est remplacée par un mécanisme de pointeur (~1 M de paramètres) et un adaptateur LoRA, qui choisit parmi des options fixes avec un score de confiance. Latence d'environ 115 ms sur RTX 3090 et 153 ms sur un MacBook M3 ; poids, données et scripts d'entraînement sont ouverts (pip install strands-decider). Il s'intègre au système d'intervention de Strands Agents pour décider Proceed/Deny/Confirm/Guide avant l'exécution d'un outil. Une brique locale et bon marché pour le routage et les garde-fous dans une boucle d'agent.

    Lire l’article complet sur sqmagazine.co.uk (nouvel onglet)
  10. Cloudflare Monetization Gateway : faire payer les agents pour les outils MCP via x402

    The New Stack

    Cloudflare ouvre en bêta fermée une passerelle permettant de facturer aux agents l'accès à des API, outils MCP, sites ou datasets, avec autorisation de paiement dans la requête HTTP via x402 (règlement en USDC sur Base). Des Virtual Wallets fixent allocations, listes blanches et plafonds par transaction, et le wrapper withX402Client du SDK Agents permet d'exiger une confirmation avant un appel d'outil payant. L'article souligne les pièges : un plafond par appel ne borne pas le coût d'une tâche longue, et les retries peuvent provoquer des doubles paiements. Les budgets par tâche et la télémétrie reliant paiements et appels d'outils deviennent nécessaires dans tout orchestrateur.

    Lire l’article complet sur thenewstack.io (nouvel onglet)