Larssen Consulting
Modèles de langage

Fenêtre de contexte

La fenêtre de contexte est la quantité maximale de texte, mesurée en tokens, qu’un modèle peut prendre en compte en une seule fois : consignes, documents, historique de la conversation et réponse en cours.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 5 sources

En clair

Imaginez un bureau de taille fixe. Tout ce dont le modèle a besoin pour travailler doit y être posé : vos consignes, les documents joints, les échanges précédents, et la réponse qu’il est en train d’écrire. Ce qui ne tient pas sur le bureau n’existe pas pour lui. Quand la conversation s’allonge, il faut retirer ou résumer d’anciens éléments pour faire de la place.

Ce bureau est la seule mémoire de travail du modèle. Entre deux conversations, il ne garde rien, sauf si l’application lui redonne des notes. Et un grand bureau ne garantit pas un bon travail : plus il est encombré, plus le modèle risque de négliger un détail utile, comme un lecteur à qui l’on remet mille pages pour répondre à une question simple.

Un exemple

Un cabinet d’audit veut interroger un rapport annuel de 300 pages. Avec les fenêtres des premiers modèles, il aurait fallu le découper et ne fournir que quelques passages. Avec les fenêtres actuelles, le rapport entier tient dans une seule demande.

L’équipe constate pourtant que les réponses sont plus fiables, et moins coûteuses, quand elle ne transmet que les chapitres concernés par la question : tout ce qui est envoyé est compté à chaque appel.

Niveau technique

Comment ça marche

La fenêtre se mesure en tokens et couvre tout l’appel : consignes système, messages, documents, images, définitions d’outils, puis la réponse générée, réflexion interne comprise 1. Si l’entrée dépasse la limite, la demande est refusée ; les applications de conversation retirent ou résument alors les échanges les plus anciens.

Les tailles ont beaucoup augmenté. GPT-3, en 2020, disposait d’une fenêtre de 2 048 tokens 2. En 2026, plusieurs modèles de premier plan acceptent un million de tokens 13, ce que Google illustre par 50 000 lignes de code ou huit romans de longueur moyenne 3. Ces chiffres changent à chaque génération : la documentation du modèle utilisé fait foi.

Une grande fenêtre n’est pas exploitée uniformément. Une étude de 2023 a montré que les modèles retrouvent mieux une information placée au début ou à la fin du contexte qu’au milieu 4. En 2025, une évaluation de 18 modèles a observé que les performances varient fortement quand l’entrée s’allonge, même sur des tâches simples 5. Cette dégradation du contexte (context rot) est désormais mentionnée dans la documentation des éditeurs 1.

D’où deux familles de réponses : ne charger que l’utile, par exemple avec la génération augmentée par récupération (RAG), et gérer le contexte dans la durée, par résumé, notes externes ou effacement des résultats devenus inutiles. C’est l’objet de l’ingénierie de contexte.

Ce que ça change pour une entreprise

Une grande fenêtre simplifie les projets : on peut fournir un contrat entier, une base de code ou une longue transcription sans découpage préalable. Pour un besoin ponctuel, c’est souvent la solution la plus rapide à mettre en place.

Mais tout ce qui se trouve dans le contexte est compté à chaque appel, et un agent qui travaille longtemps renvoie son historique à chaque étape. Les longues entrées alourdissent la facture, ralentissent la réponse et peuvent diluer l’information utile. La bonne pratique consiste à trier ce que le modèle reçoit, pas à remplir la fenêtre parce qu’elle est grande.

Idées reçues

  • « Plus la fenêtre est grande, meilleures sont les réponses. »

    Pas nécessairement : quand le contexte s’allonge, la précision tend à baisser. Un contexte court et bien choisi donne souvent de meilleurs résultats.

  • « Le modèle se souvient de nos anciennes conversations. »

    Il ne voit que ce qui se trouve dans la fenêtre au moment de l’appel. Une mémoire durable est une fonction ajoutée par l’application.

  • « La fenêtre de contexte, c’est ce que le modèle a appris. »

    Non : ses connaissances viennent de l’entraînement. La fenêtre est sa mémoire de travail, vide au début de chaque conversation.

Sources

  1. Anthropic, documentation Claude, « Context windows »
  2. Brown et al., « Language Models are Few-Shot Learners », 2020
  3. Google, documentation de l’API Gemini, « Long context »
  4. Liu et al., « Lost in the Middle: How Language Models Use Long Contexts », 2023
  5. Hong, Troynikov et Huber (Chroma), « Context Rot: How Increasing Input Tokens Impacts LLM Performance », 2025

Voir aussi