En clair
Un modèle de langage ne consulte pas une base de faits : il écrit la suite la plus plausible d’un texte. La plupart du temps, le plausible et le vrai coïncident. Parfois non. Le modèle produit alors une phrase bien construite, au ton assuré, et fausse. Rien dans la forme ne signale l’erreur : c’est ce qui la rend difficile à repérer.
Pensez à un élève devant une question d’examen dont il ignore la réponse. S’il n’est pas pénalisé pour une erreur, il a intérêt à tenter une réponse vraisemblable plutôt qu’à laisser un blanc. Les modèles sont entraînés et évalués d’une façon qui encourage ce réflexe. Ils ne mentent pas, au sens où ils ne cherchent pas à tromper : ils complètent.
Un exemple
En 2023, à New York, deux avocats ont déposé devant un tribunal fédéral un mémoire citant plusieurs décisions de justice qui n’existaient pas. Elles avaient été produites par ChatGPT, que l’un d’eux disait avoir pris pour une sorte de moteur de recherche. Le 22 juin 2023, le juge a prononcé une sanction de 5 000 dollars contre les avocats et leur cabinet 5.
La leçon vaut pour toute organisation : la faute retenue n’est pas d’avoir utilisé un modèle, mais d’avoir transmis son texte sans vérifier les sources, puis de l’avoir maintenu.
Comment ça marche
La recherche distingue deux cas. L’hallucination intrinsèque contredit la source fournie au modèle, par exemple un résumé qui affirme autre chose que le document. L’hallucination extrinsèque ajoute une information que la source ne permet ni de confirmer ni d’infirmer 1. Dans l’usage courant, le terme couvre aussi les erreurs factuelles commises sans aucune source.
Pourquoi le phénomène persiste-t-il ? Une analyse publiée en 2025 avance deux causes : des pressions statistiques pendant le pré-entraînement, qui produisent des erreurs dès qu’une affirmation fausse ne se distingue pas d’un fait, et des méthodes d’évaluation qui récompensent la réponse tentée plutôt que l’aveu d’incertitude 2. Un autre travail soutient, par un argument formel, qu’un modèle utilisé comme solveur universel hallucinera inévitablement 3.
Les parades agissent sur le contexte et sur le contrôle. Fournir au modèle les documents pertinents, par génération augmentée par récupération (RAG), ancre la réponse dans des sources 4. S’y ajoutent l’exigence de citations vérifiables, l’autorisation explicite de répondre « je ne sais pas », la vérification automatique des sorties et la relecture humaine. Ces mesures réduisent le taux d’erreur sans l’annuler.
Ce que ça change pour une entreprise
Le risque dépend de l’usage. Dans un brouillon relu par un expert, une hallucination coûte quelques minutes. Dans une réponse envoyée telle quelle à un client, un rapport financier ou un document juridique, elle engage la responsabilité de l’entreprise. C’est ce critère, et non la performance moyenne du modèle, qui doit fixer le niveau de contrôle.
Réduire les hallucinations a un coût : préparation des sources, système de récupération, tests, temps de relecture. Aucun fournisseur ne garantit un taux nul. Mesurez le taux d’erreur sur vos propres cas, exigez des citations que l’on peut ouvrir, et réservez l’envoi sans relecture aux situations où l’erreur est tolérable.
Idées reçues
- « Les hallucinations sont un bug qui sera bientôt corrigé. »
Elles découlent du fonctionnement même des modèles. Leur fréquence peut être réduite, mais rien ne permet d’annoncer leur disparition.
- « Si le modèle cite une source, c’est fiable. »
Une référence peut être inventée de toutes pièces, ou réelle mais sans rapport avec l’affirmation. Il faut l’ouvrir.
- « Avec la température à zéro, il n’y a plus d’erreur. »
Ce réglage rend les réponses plus stables, pas plus vraies. Un modèle peut répéter la même erreur à chaque essai.
Sources
- Ji et al., « Survey of Hallucination in Natural Language Generation », 2022
- Kalai et al., « Why Language Models Hallucinate », 2025
- Xu, Jain et Kankanhalli, « Hallucination is Inevitable: An Innate Limitation of Large Language Models », 2024
- Lewis et al., « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », 2020
- Tribunal fédéral du district sud de New York, Mata v. Avianca, Inc., décision sur les sanctions, 22 juin 2023