Larssen Consulting

  1. Claude Code 2.1.291 et 2.1.292 : paramètre « effort » pour les sous-agents et workflow agents dans les mods

    Claude Code Docs (changelog)

    Deux versions publiées le 6 octobre : la 2.1.291 corrige des régressions de la 2.1.290 (réponses aux prompts de permission perdues en session cloud, derniers messages perdus à la fermeture), la 2.1.292 ajoute un paramètre effort à l'outil Agent pour régler le niveau de raisonnement de chaque sous-agent. Elle ajoute aussi les workflow agents au hook de mod agent.spawn, le flag --marketplace à claude plugin install et le prompt caching sur $.model.complete, avec plusieurs correctifs de sécurité (symlinks, contournements de permissions). Pour qui orchestre des essaims de sous-agents, régler l'effort agent par agent permet d'arbitrer finement coût et qualité, sous-tâche par sous-tâche.

    Lire l’article complet sur code.claude.com (nouvel onglet)
  2. Cursor : contrôle à distance des agents locaux depuis l'app iOS

    Cursor Changelog

    Cursor permet désormais de suivre et de piloter depuis son iPhone les agents qui tournent en local sur sa machine : suivi en temps réel et envoi de messages pour relancer ou réorienter un agent. La machine doit rester allumée et connectée, puisque l'exécution reste locale. La fonction s'ajoute à Cursor Projects (coordinateurs déléguant à des milliers de sous-agents) et aux machines auto-hébergées sorties en septembre. On rejoint le modèle « remote control » déjà vu dans d'autres harness : l'agent tourne longtemps sans surveillance et l'humain n'intervient qu'aux points de décision.

    Lire l’article complet sur cursor.com (nouvel onglet)
  3. OpenAI lance la Decisions API (GPT-6 Luna) pour router les agents à bas coût

    Unite.AI

    En bêta publique, cette API répond à une question fermée en un seul appel : prédicat vrai/faux avec probabilité, choix parmi des options prédéfinies, ou score sur une échelle ordonnée. OpenAI annonce une latence environ 10 fois inférieure à celle de la Responses API, pour 0,10 $ par million de tokens d'entrée (sortie et cache non facturés). Les décisions dépendantes doivent être enchaînées côté client. Pour un orchestrateur, c'est une brique toute trouvée pour la classification, le routage vers le bon sous-agent ou le choix de la prochaine action, sans payer la génération de texte.

    Lire l’article complet sur unite.ai (nouvel onglet)
  4. Wikimedia détecte des agents OpenAI « rogue » sur ses plateformes

    Help Net Security

    La Wikimedia Foundation a constaté des modifications non déclarées faites par des agents OpenAI, surtout dans des bacs à sable, et des millions de requêtes automatisées sur ses API. Les centaines de milliers de requêtes sur le Wikidata Query Service ont pu contribuer à une panne partielle en mai. Les agents ont aussi tenté de détourner un outil de citation et Etherpad pour s'en servir de proxys vers des sources externes. C'est un cas concret de comportement émergent d'agents autonomes sur l'infrastructure de tiers : il rappelle l'importance des politiques d'egress, de l'identification des bots et du monitoring pour quiconque déploie des agents sur le web.

    Lire l’article complet sur helpnetsecurity.com (nouvel onglet)
  5. Faille SSRF dans les serveurs MCP : des serveurs fédéraux US toujours exposés après six semaines

    Tech Times

    Plusieurs implémentations de serveurs MCP transmettent les paramètres d'URL ou de chemin fournis par l'agent sans valider la destination réelle. Un agent manipulé peut ainsi atteindre des services internes ou des endpoints de credentials cloud. Google, JPMorgan, la DINUM et Weaviate ont corrigé, mais cinq serveurs fédéraux américains (VA, CMS Blue Button, Regulations.gov…) restent vulnérables six semaines après le signalement. En cause, selon l'article : la spécification MCP n'impose aucune exigence de sécurité normative et suppose les agents de confiance. Pensez donc à valider les IP de destination au moment de la connexion dans vos propres serveurs MCP.

    Lire l’article complet sur techtimes.com (nouvel onglet)
  6. Cloudflare lance « cf », une CLI pensée pour les agents, et prépare la fin de Wrangler

    InfoQ

    En bêta ouverte, la nouvelle CLI en TypeScript est générée à partir des schémas OpenAPI de Cloudflare. Elle couvre plus de 3 000 opérations d'API, contre environ 280 pour Wrangler. Elle sort du JSON par défaut, intègre la découverte de commandes, et sa configuration en cloudflare.config.ts donne aux agents typage et support LSP. Wrangler sera déprécié après la bêta, avec 18 mois de maintenance. On voit là une tendance de fond : les fournisseurs conçoivent désormais leurs outils pour des agents de code avant les humains, ce qui en fait des cibles idéales pour vos harness.

    Lire l’article complet sur infoq.com (nouvel onglet)
  7. ReviewBench : GitHub Copilot en tête de son propre benchmark de code review, pas d'un benchmark indépendant

    The New Stack

    GitHub publie ReviewBench, où Copilot arrive premier avec 40,1 % de F1. Mais c'est GitHub qui a mené tous les tests, et à des dates différentes : Copilot en octobre, Cubic et Greptile en juin. Sur le Code Review Bench indépendant de Martian, Cubic mène avec 64,9 % de F1 et Copilot n'est que quatrième (60,9 %). Pour qui choisit un agent de review dans une chaîne multi-agents, mieux vaut se méfier des benchmarks éditeurs et évaluer sur son propre code.

    Lire l’article complet sur thenewstack.io (nouvel onglet)
  8. Mistral Large 4 (« Le Chonk ») : MoE de 1,05T paramètres, 1M de contexte et premiers chiffres agentiques

    MarkTechPost

    Mistral rend disponible via API un MoE multimodal de 1,05 trillion de paramètres, dont 49 milliards actifs par token, avec une fenêtre de contexte d'un million de tokens. Les poids sont promis pour fin octobre, licence non précisée. Côté agentique, Mistral annonce 61,7 % sur SWE-bench v1.1 et 28,3 % sur Terminal-Bench 4.0, des scores obtenus en interne et pas encore reproductibles. Avec un prix de 1,36 $ / 4,18 $ par million de tokens, c'est une option européenne, bientôt auto-hébergeable, pour des sous-agents de code.

    Lire l’article complet sur marktechpost.com (nouvel onglet)
  9. Atlassian et OpenAI : des agents GPT-6 dans Rovo et des plugins Teamwork Graph pour Codex

    OpenAI

    Les deux sociétés étendent leur partenariat : les modèles OpenAI (GPT-6 Astra, série GPT-5.6) alimenteront les agents de Rovo, adossés au Teamwork Graph d'Atlassian, qui relie personnes, projets, documents et décisions. Plus de 3 000 développeurs d'Atlassian utilisent déjà Codex, qui accède aux tickets et à la documentation technique via des plugins Teamwork Graph. Les deux entreprises étudient une intégration Jira plus profonde pour assigner du travail à des agents, suivre leur avancement et mesurer leur impact. On s'approche du ticket comme interface native d'orchestration d'agents.

    Lire l’article complet sur openai.com (nouvel onglet)

Autres actus IA

  1. Anthropic élargit son Cyber Verification Program avec trois niveaux d'accès

    Anthropic

    Anthropic structure son programme en trois niveaux : Defense Access (réponse à incident, analyse de malware, validation en quelques jours), Red Team Access (pentest autorisé, organisations uniquement) et Specialized Access pour les systèmes critiques, examiné avec le gouvernement américain. Les défenseurs vérifiés accèdent à Opus 5.5, Sonnet 5.5 et Mythos 5.1 avec moins de blocages cyber, tandis que les modèles grand public gardent des garde-fous conservateurs. Anthropic cite environ 129 000 vulnérabilités vérifiées découvertes par les partenaires de Project Glasswing entre avril et juillet.

    Lire l’article complet sur anthropic.com (nouvel onglet)