En clair
Posez un calcul difficile à quelqu’un en exigeant une réponse immédiate : il se trompera souvent. Donnez-lui une feuille de brouillon et quelques minutes : il pose les étapes, vérifie, corrige. Un modèle de raisonnement fonctionne ainsi. Avant d’écrire sa réponse, il rédige pour lui-même une réflexion, parfois longue, puis conclut.
Cette réflexion n’est pas un organe à part : c’est du texte, produit par le même mécanisme que le reste, sur lequel le modèle s’appuie pour continuer. Elle est utile quand le problème demande plusieurs étapes, comme une analyse, un plan, un programme ou un calcul. Pour une question simple, elle n’apporte rien et rallonge l’attente. Beaucoup de modèles récents dosent donc eux-mêmes cet effort, ou laissent l’utilisateur le régler.
Un exemple
Une direction financière compare trois scénarios de financement, avec des taux, des durées et des clauses différentes. Un modèle classique donne une réponse fluide, mais se trompe dans un calcul intermédiaire. Le modèle de raisonnement pose chaque scénario, calcule les coûts, repère une clause de remboursement anticipé qui change le classement, puis présente sa conclusion.
La réponse arrive après une attente plus longue et coûte plus cher. L’équipe réserve donc ce mode aux analyses, et garde un réglage rapide pour les questions courantes.
Comment ça marche
L’origine est une technique de prompt. En 2022, un article montre qu’en donnant au modèle quelques exemples de raisonnement par étapes (chain of thought), on améliore nettement ses résultats en arithmétique et en logique 1. Les modèles de raisonnement intègrent ce comportement par l’entraînement. Le genre se diffuse à partir de septembre 2024 avec le modèle o1 d’OpenAI ; en février 2025, Anthropic présente Claude 3.7 Sonnet comme un modèle hybride, capable de répondre vite ou de réfléchir longuement 6.
- LireLe modèle reçoit la demande et son contexte.
- RéfléchirIl rédige un brouillon : étapes, hypothèses, calculs.
- VérifierIl reprend ce brouillon et corrige ce qui ne tient pas.
- RépondreIl rédige la réponse finale, généralement plus courte.
Le brouillon est facturé, même lorsqu’il n’est pas affiché.
DeepSeek-R1, publié en janvier 2025 puis dans Nature, montre que cette aptitude peut être obtenue par apprentissage par renforcement, sans démonstrations de raisonnement annotées par des humains ; des comportements comme la vérification et le changement de stratégie y apparaissent au cours de l’entraînement 2.
En pratique, le modèle génère des tokens de raisonnement avant sa réponse. Ils occupent la fenêtre de contexte et sont facturés comme des tokens de sortie, même lorsqu’ils ne sont pas affichés 34. Les fournisseurs proposent un réglage de l’effort, du plus léger au plus poussé 3, ou laissent le modèle décider s’il doit réfléchir et combien, ce qu’Anthropic appelle la réflexion adaptative 4.
Deux réserves alimentent le débat. Une étude de 2025 observe, sur des casse-tête de complexité croissante, un effondrement complet de la précision au-delà d’un certain seuil 5. Par ailleurs, la réflexion affichée n’est pas un compte rendu fidèle du calcul réel : une autre étude montre que des modèles ayant utilisé un indice glissé dans la consigne ne le mentionnent souvent que dans moins de 20 % des cas 7.
Ce que ça change pour une entreprise
Le raisonnement améliore les résultats là où une réponse immédiate échoue : analyse de documents complexes, planification, programmation, questions à plusieurs contraintes. Il est aussi au cœur des agents, qui doivent décider de la prochaine action à chaque étape.
Il se paie en temps et en argent : la réflexion s’ajoute aux tokens de sortie, et l’attente s’allonge. Pour un tri de courriels ou une reformulation, c’est une dépense inutile. La bonne pratique consiste à régler l’effort selon la tâche et à mesurer le gain réel sur vos cas. Le raisonnement affiché aide à comprendre une réponse, mais ne constitue pas une preuve de la façon dont elle a été obtenue.
Idées reçues
- « Un modèle de raisonnement ne se trompe plus. »
Il se trompe moins sur les problèmes à étapes. Il peut toujours partir d’une hypothèse fausse et dérouler un raisonnement cohérent mais erroné.
- « Le raisonnement affiché montre ce que le modèle pense vraiment. »
C’est un texte utile, pas une radiographie. Des études montrent qu’il omet parfois des éléments qui ont influencé la réponse.
- « Il faut toujours activer la réflexion. »
Sur une tâche simple, elle ajoute du délai et du coût sans gain.
Sources
- Wei et al., « Chain-of-Thought Prompting Elicits Reasoning in Large Language Models », 2022
- Guo et al. (DeepSeek-AI), « DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning », Nature, 2025
- OpenAI, documentation de l’API, « Reasoning models »
- Anthropic, documentation Claude, « Thinking »
- Shojaee et al., « The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity », 2025
- Anthropic, « Claude 3.7 Sonnet and Claude Code », février 2025
- Chen et al., « Reasoning Models Don’t Always Say What They Think », 2025