En clair
À chaque mot, le modèle dispose d’une liste de suites possibles, chacune avec une probabilité. Après « Le ciel est », « bleu » est très probable, « gris » un peu moins, « électrique » beaucoup moins. La température règle la façon de piocher dans cette liste. Proche de zéro, le modèle prend presque toujours le premier choix. Plus haute, il laisse leur chance aux suivants.
L’image du curseur convient bien : d’un côté la régularité, de l’autre la variété. Un curseur bas convient à l’extraction de données ou au classement, où l’on attend la même réponse à chaque fois. Un curseur plus haut convient à la recherche d’idées ou de formulations. Poussé trop loin, le texte perd sa cohérence, comme un orateur qui tirerait ses mots aux dés.
Un exemple
Une équipe marketing utilise le même modèle pour deux tâches. Pour extraire les montants et les dates de factures, elle fixe une température basse : la même facture doit donner le même résultat. Pour proposer dix accroches publicitaires, elle la relève, afin d’obtenir des propositions réellement différentes.
Quand l’outil ne permet pas ce réglage, elle obtient un effet voisin par la consigne : demander explicitement plusieurs variantes, ou au contraire imposer un format strict.
Comment ça marche
Le modèle calcule un score (logit) pour chaque token du vocabulaire. La fonction softmax convertit ces scores en probabilités ; la température T divise les scores avant cette conversion. Avec T égal à 1, la distribution est celle que le modèle a apprise. Une valeur plus élevée produit une distribution plus étalée 1, une valeur plus faible une distribution plus resserrée. À la limite de zéro, le modèle retient toujours le token le plus probable.
Viser systématiquement le texte le plus probable ne donne pas le meilleur résultat : une étude de 2019 a montré que cette stratégie produit des textes ternes et répétitifs. Elle a proposé de tirer au sort dans le « noyau » de la distribution, en écartant la queue des tokens les moins fiables, méthode appelée échantillonnage par noyau (nucleus sampling) ou top-p 2. Température et top-p sont les deux réglages les plus courants.
Les plages diffèrent selon les fournisseurs : de 0 à 2 dans l’API d’OpenAI 4, de 0 à 1 dans celle d’Anthropic, dont la documentation précise que, même à 0, les résultats ne sont pas totalement déterministes 3. Le réglage n’est plus universel : Anthropic indique que ses modèles les plus récents n’acceptent plus de valeur personnalisée 3.
Ce que ça change pour une entreprise
Pour un usage en production, la température est un réglage de régularité. Les tâches répétables (extraction, classement, réponses encadrées) gagnent à une valeur basse, qui facilite aussi les tests. Les tâches créatives supportent mieux une valeur plus haute. Dans les deux cas, le bon réglage se trouve par essais sur des exemples réels.
Ses limites sont nettes. Une température basse ne rend pas une réponse exacte : elle la rend stable. Elle ne garantit pas non plus des sorties strictement identiques d’un appel à l’autre. Enfin, le paramètre n’est pas disponible partout : certains modèles récents ne l’exposent plus, ce qui oblige à obtenir la régularité par la consigne, des formats imposés et des contrôles en sortie.
Idées reçues
- « Température zéro, résultat toujours identique. »
Presque, pas toujours. Des fournisseurs préviennent que de légères variations subsistent.
- « Une température élevée rend le modèle plus créatif. »
Elle rend ses choix plus variés. Au-delà d’un certain point, la variété devient de l’incohérence.
- « Baisser la température supprime les hallucinations. »
Elle n’agit pas sur ce que le modèle sait. Une erreur très probable sera simplement répétée à chaque fois.