Larssen Consulting
Modèles de langage

Température

La température est le réglage qui détermine la part de hasard dans le choix de chaque mot par un modèle de langage : basse, elle donne des réponses stables et prévisibles ; élevée, des réponses plus variées et plus risquées.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 4 sources

En clair

À chaque mot, le modèle dispose d’une liste de suites possibles, chacune avec une probabilité. Après « Le ciel est », « bleu » est très probable, « gris » un peu moins, « électrique » beaucoup moins. La température règle la façon de piocher dans cette liste. Proche de zéro, le modèle prend presque toujours le premier choix. Plus haute, il laisse leur chance aux suivants.

L’image du curseur convient bien : d’un côté la régularité, de l’autre la variété. Un curseur bas convient à l’extraction de données ou au classement, où l’on attend la même réponse à chaque fois. Un curseur plus haut convient à la recherche d’idées ou de formulations. Poussé trop loin, le texte perd sa cohérence, comme un orateur qui tirerait ses mots aux dés.

Un exemple

Une équipe marketing utilise le même modèle pour deux tâches. Pour extraire les montants et les dates de factures, elle fixe une température basse : la même facture doit donner le même résultat. Pour proposer dix accroches publicitaires, elle la relève, afin d’obtenir des propositions réellement différentes.

Quand l’outil ne permet pas ce réglage, elle obtient un effet voisin par la consigne : demander explicitement plusieurs variantes, ou au contraire imposer un format strict.

Niveau technique

Comment ça marche

Le modèle calcule un score (logit) pour chaque token du vocabulaire. La fonction softmax convertit ces scores en probabilités ; la température T divise les scores avant cette conversion. Avec T égal à 1, la distribution est celle que le modèle a apprise. Une valeur plus élevée produit une distribution plus étalée 1, une valeur plus faible une distribution plus resserrée. À la limite de zéro, le modèle retient toujours le token le plus probable.

Viser systématiquement le texte le plus probable ne donne pas le meilleur résultat : une étude de 2019 a montré que cette stratégie produit des textes ternes et répétitifs. Elle a proposé de tirer au sort dans le « noyau » de la distribution, en écartant la queue des tokens les moins fiables, méthode appelée échantillonnage par noyau (nucleus sampling) ou top-p 2. Température et top-p sont les deux réglages les plus courants.

Les plages diffèrent selon les fournisseurs : de 0 à 2 dans l’API d’OpenAI 4, de 0 à 1 dans celle d’Anthropic, dont la documentation précise que, même à 0, les résultats ne sont pas totalement déterministes 3. Le réglage n’est plus universel : Anthropic indique que ses modèles les plus récents n’acceptent plus de valeur personnalisée 3.

Ce que ça change pour une entreprise

Pour un usage en production, la température est un réglage de régularité. Les tâches répétables (extraction, classement, réponses encadrées) gagnent à une valeur basse, qui facilite aussi les tests. Les tâches créatives supportent mieux une valeur plus haute. Dans les deux cas, le bon réglage se trouve par essais sur des exemples réels.

Ses limites sont nettes. Une température basse ne rend pas une réponse exacte : elle la rend stable. Elle ne garantit pas non plus des sorties strictement identiques d’un appel à l’autre. Enfin, le paramètre n’est pas disponible partout : certains modèles récents ne l’exposent plus, ce qui oblige à obtenir la régularité par la consigne, des formats imposés et des contrôles en sortie.

Idées reçues

  • « Température zéro, résultat toujours identique. »

    Presque, pas toujours. Des fournisseurs préviennent que de légères variations subsistent.

  • « Une température élevée rend le modèle plus créatif. »

    Elle rend ses choix plus variés. Au-delà d’un certain point, la variété devient de l’incohérence.

  • « Baisser la température supprime les hallucinations. »

    Elle n’agit pas sur ce que le modèle sait. Une erreur très probable sera simplement répétée à chaque fois.

Sources

  1. Hinton, Vinyals et Dean, « Distilling the Knowledge in a Neural Network », 2015
  2. Holtzman et al., « The Curious Case of Neural Text Degeneration », 2019
  3. Anthropic, référence de l’API Messages (paramètre temperature)
  4. OpenAI, référence de l’API Responses (paramètre temperature)

Voir aussi