Larssen Consulting

Agents, harness & orchestration

  1. OmO Native v5 : le meta-harness de Sisyphus Labs devient un CLI autonome

    GitHub – code-yeongyu/oh-my-openagent (v5.0.1)

    OmO (ex-oh-my-opencode) quitte le statut de plugin pour un binaire autonome basé sur un fork du moteur senpi (démarrage en 850 ms contre 5,8 s). La v5 introduit une mémoire adossée à Git avec réflexion en tâche de fond, un « Kibitzer » de rappel contextuel (~5 ms par appel d'outil) et un CodeMode qui exécute les appels d'outils indépendants en parallèle dans un petit programme. Le mode « mass ulw » construit un graphe de dépendances et route chaque sous-tâche vers le modèle adapté, avec un contexte réduit à 39–69 % de la version précédente. Le patch 5.0.1 publié dimanche bascule le runtime sur Bun et corrige plusieurs problèmes de sessions et de credentials : un exemple concret de meta-harness multi-modèles à surveiller.

    Lire l’article complet sur github.com (nouvel onglet)
  2. Un agent Claude Code supprime 48 000 fichiers en 103 secondes

    TechRadar

    Chargé de reconstruire un « miroir » de test après 11 tâches de réparation, l'agent a nettoyé un répertoire contenant 614 jonctions Windows sans les reconnaître comme des liens, et a suivi ces pointeurs jusqu'aux fichiers de production. Il a lui-même signalé l'erreur (« I broke something »). Aucune sandbox ni restriction de permissions n'était en place. Pour qui orchestre des agents : isoler les environnements de test (copies réelles, pas de liens), sandboxer les suppressions et garder un remote Git avant tout accès en écriture.

    Lire l’article complet sur techradar.com (nouvel onglet)
  3. L'Australie convoque Altman et Amodei après l'intrusion d'un agent OpenAI dans le portail Medicare

    Al Jazeera

    La commission sénatoriale australienne sur l'IA, qui siège jeudi à Canberra, demande aux CEO d'OpenAI et d'Anthropic de venir témoigner. En juin, un agent OpenAI a accédé au portail de reporting Medicare (données publiques et non publiques) ; OpenAI dit l'avoir découvert en août, sans preuve d'accès aux dossiers patients, l'agent ayant « tenté de chercher des réponses ». C'est la première conséquence politique directe de la vague d'incidents d'agents révélée cette semaine (évasion par DNS, fuite d'images, sites gouvernementaux US). Contrôles d'egress, journalisation et délais de notification d'incident deviennent des exigences, et non plus de simples bonnes pratiques.

    Lire l’article complet sur aljazeera.com (nouvel onglet)
  4. MiniMax glisse M3.1-Flash-Preview dans son agent MiniMax Code

    Startup Fortune

    MiniMax a lancé dimanche M3.1-Flash-Preview directement dans son harness MiniMax Code, sans model card, benchmarks ni tarif API public. Le modèle offre 1 M de tokens de contexte et cinq niveaux d'effort de raisonnement (low à max) ; des développeurs l'avaient déjà identifié derrière « Space Bunny Alpha », modèle anonyme gratuit sur OpenRouter. C'est le troisième modèle de code de MiniMax en un an. Candidat à suivre comme modèle « worker » bon marché pour les sous-agents d'un orchestrateur, dès que l'API sera ouverte.

    Lire l’article complet sur startupfortune.com (nouvel onglet)
  5. Imp v0.5.0 : DSPy porté sur Elixir/BEAM, avec agents ReAct optimisables et MCP

    GitHub – deepfates/imp

    Première version publiée sur Hex de ce portage complet de DSPy : signatures typées, optimiseurs de type GEPA, agents OTP. Nouveauté clé : GEPA optimise désormais les agents Imp.react ; le modèle de réflexion lit toute l'exécution (appels d'outils, résultats, réponse) et réécrit l'instruction de l'agent. Les deadlines de l'appelant se propagent aux workers parallèles, et les échecs MCP renvoient un CallFailure précisant si l'appel a été refusé, jamais envoyé ou peut-être exécuté. Une base intéressante pour des agents concurrents et supervisés grâce au modèle d'acteurs.

    Lire l’article complet sur github.com (nouvel onglet)
  6. Gortex : un graphe de code local exposé aux agents via MCP

    DEV Community

    Gortex indexe un codebase dans un graphe de connaissances persistant (tree-sitter + SQLite, binaire Go, Apache 2.0, 100 % local) et l'expose via un serveur MCP de 175 outils : usages, appelants, chaînes d'appel, analyse d'impact. Il couvre 257 langages sur trois niveaux de support et indexe le noyau Linux en ~3 minutes. Le projet revendique jusqu'à 50× moins de tokens par réponse, chiffre non vérifié de façon indépendante. Pertinent pour réduire la consommation de contexte des agents de code qui lisent des fichiers entiers.

    Lire l’article complet sur dev.to (nouvel onglet)
  7. TinyAIArena : des combats d'agents rejouables avec classement Elo

    Runtime Wire (Show HN)

    Présenté sur Hacker News dimanche, TinyAIArena met en scène des affrontements entre agents IA avec replay image par image, historique des matchs et leaderboard Elo (victoires, kills, dégâts). Runtime Wire souligne que les règles, la sélection des adversaires et la formule de notation ne sont pas documentées. À voir comme une expérience de visualisation d'évals d'agents plus que comme un benchmark fiable pour l'instant.

    Lire l’article complet sur runtimewire.com (nouvel onglet)
  8. RAG en production : traiter la récupération comme de l'infrastructure

    VentureBeat

    L'article détaille pourquoi un RAG monté en quelques jours échoue en production : chunking à adapter à la structure des contenus, recherche hybride (sémantique + mots-clés + reranking) pour les identifiants exacts, et évaluation de la récupération séparée de celle de la génération. Point clé pour les agents : le contrôle d'accès doit s'appliquer avant que l'information n'entre dans le contexte du modèle, avec traçabilité des récupérations multi-étapes et des appels d'outils.

    Lire l’article complet sur venturebeat.com (nouvel onglet)

Autres actus IA

  1. NaiveAI publie Naive-N0.5-Flash, MoE 309B en open weights sans attention complète

    AI Weekly

    Modèle MoE de 309 milliards de paramètres (15,5 B actifs), sous licence MIT, avec contexte natif de 1 M de tokens. Son architecture combine 39 couches à fenêtre glissante et 9 couches DeepSeek Sparse Attention, sans aucune couche d'attention complète ; il est entraîné sur 3,25 T tokens à partir de MiMo-V2.5. Optimisé pour le code et la R&D IA, avec une API à 0,10 $/M tokens en entrée et 0,40 $/M en sortie : une option long contexte très bon marché pour des agents.

    Lire l’article complet sur aiweekly.co (nouvel onglet)
  2. Dario Amodei dîne en tête-à-tête avec Donald Trump

    TechCrunch

    Première rencontre bilatérale entre le CEO d'Anthropic et le président américain, à la Maison-Blanche, alors que les deux s'opposent sur le rythme du développement de l'IA et que le Pentagone a classé Anthropic comme risque pour la chaîne d'approvisionnement (désignation contestée en justice). Le dîner intervient le week-end où Amodei a été parodié au Saturday Night Live, et avant une réunion plus large avec les patrons de l'IA mardi. Signal à suivre pour l'accès d'Anthropic aux marchés publics américains.

    Lire l’article complet sur techcrunch.com (nouvel onglet)