Larssen Consulting
Agents et outils

Ingénierie de contexte

context engineering

L’ingénierie de contexte (context engineering) regroupe les méthodes qui déterminent quelles informations un modèle de langage a sous les yeux à chaque étape de son travail, afin qu’il dispose de l’essentiel sans être noyé sous le superflu.

  • Lecture : 4 minutes
  • Mis à jour le 8 octobre 2026
  • 3 sources

En clair

Un modèle de langage n’a pas de mémoire entre deux appels. À chaque fois, il ne connaît de la situation que ce qui figure dans le texte qu’on lui transmet : les consignes, la question, les documents joints, la liste des outils, le fil de la conversation. Cet ensemble s’appelle le contexte. L’ingénierie de contexte consiste à le composer avec soin, puis à le tenir à jour pendant que le travail avance.

Pensez au dossier que l’on prépare pour un expert appelé en renfort une heure. S’il ne reçoit que deux lignes, il devine. S’il reçoit trois cartons d’archives, il se perd et passe à côté de la pièce décisive. Un bon dossier contient la mission, les règles, les quelques documents qui comptent et un résumé de ce qui a déjà été fait.

La rédaction de prompts s’occupe de la manière de formuler une demande. L’ingénierie de contexte voit plus large : elle traite tout ce qui entoure cette demande, et la façon dont cet ensemble évolue au fil des étapes. Elle devient décisive avec les agents, qui travaillent longtemps et accumulent des résultats intermédiaires qu’il faut trier.

Un exemple

Un agent traite des dossiers de sinistre pour un assureur. Dans sa première version, on lui fournissait à chaque étape le contrat entier, tous les échanges avec l’assuré et quarante outils. Il confondait les garanties et oubliait des pièces. L’équipe revoit le contexte : consignes resserrées, huit outils, et les seules clauses qui concernent le sinistre, récupérées à la demande.

L’agent tient aussi une fiche de suivi, pièces reçues, points à vérifier, décisions prises, qu’il relit à chaque étape au lieu de reparcourir tout l’historique. Les erreurs reculent et le coût par dossier baisse, sans changer de modèle.

Niveau technique

Comment ça marche

Anthropic définit l’ingénierie de contexte comme l’ensemble des stratégies qui visent à constituer et à entretenir le jeu de tokens optimal pendant l’inférence, et la présente comme le prolongement de l’ingénierie de prompt à l’ère des agents 1. Le principe directeur : trouver le plus petit ensemble de tokens à fort signal qui maximise les chances d’obtenir le résultat voulu.

Cette sobriété répond à une limite mesurée. Dès 2023, des chercheurs ont montré que les modèles exploitent mieux une information placée au début ou à la fin d’un long contexte qu’au milieu 2. En 2025, une étude de Chroma portant sur 18 modèles a observé que la fiabilité baisse à mesure que l’entrée s’allonge, même sur des tâches simples, un phénomène baptisé dégradation du contexte (context rot) 3. Une grande fenêtre de contexte se gère donc comme un budget d’attention limité.

Pour les tâches longues, quatre techniques reviennent 1. La récupération juste à temps : l’agent garde des références légères, chemins de fichiers ou liens, et charge le contenu quand il en a besoin. Le compactage : l’historique est résumé quand la fenêtre se remplit. La prise de notes structurée : l’agent écrit dans une mémoire externe qu’il relira plus tard. Les sous-agents : une exploration coûteuse a lieu dans un contexte séparé, dont seul le résumé remonte.

Ce que ça change pour une entreprise

Quand un assistant ou un agent déçoit, la cause tient souvent moins au modèle qu’à ce qu’on lui a donné à lire : consignes contradictoires, documents périmés, outils redondants, historique trop long. Soigner le contexte est donc l’un des leviers les plus rentables. Il améliore la qualité, et comme chaque token d’entrée est facturé et ralentit la réponse, il réduit aussi le coût et le temps d’attente.

Ce travail demande une compétence qui croise connaissance du métier et pratique des modèles, ainsi que des jeux de test pour mesurer l’effet de chaque changement. Rien n’est acquis une fois pour toutes : un réglage adapté à un modèle peut devoir être revu au suivant. Le compactage comporte aussi un risque, celui de perdre en route un détail qui se révélera important.

Idées reçues

  • « C’est un nouveau nom pour l’ingénierie de prompt. »

    Le prompt n’est qu’une pièce du contexte. S’y ajoutent les outils, les documents récupérés, la mémoire et l’historique, qui changent à chaque étape d’une tâche longue.

  • « Avec une fenêtre d’un million de tokens, on peut tout mettre. »

    Tout mettre coûte cher et dégrade la fiabilité. Les études montrent que les performances baissent quand l’entrée s’allonge, même pour des modèles conçus pour les longs contextes.

  • « Plus on donne d’informations, mieux le modèle répond. »

    Une information inutile n’est pas neutre : elle disperse l’attention du modèle et peut l’entraîner sur une fausse piste.

Sources

  1. Anthropic, « Effective context engineering for AI agents », septembre 2025
  2. Liu et al., « Lost in the Middle: How Language Models Use Long Contexts », 2023
  3. Hong et al., « Context Rot: How Increasing Input Tokens Impacts LLM Performance », Chroma, 2025

Voir aussi