En clair
Votre téléphone propose le mot suivant quand vous écrivez un message. Un grand modèle de langage fait la même chose, à une tout autre échelle : il a été entraîné sur une part considérable de ce qui s’écrit, livres, sites web, code informatique, et il a appris à deviner la suite la plus plausible d’un texte. Quand vous lui posez une question, il ne cherche pas la réponse dans une base : il l’écrit, un fragment de mot après l’autre.
Ce qui surprend, c’est tout ce que cette seule aptitude permet. Pour bien prédire la suite d’une démonstration, d’un contrat ou d’un programme, le modèle a dû capter une part de la grammaire, des faits, des styles et des raisonnements présents dans ses textes d’entraînement. Il n’a pourtant ni souvenir de vos échanges passés, ni accès au monde extérieur, sauf si l’application qui l’entoure les lui fournit.
Un exemple
Un service juridique reçoit chaque semaine des dizaines de contrats fournisseurs. Un grand modèle de langage en extrait les clauses sensibles (durée, pénalités, résiliation), les compare au modèle maison et rédige une note de synthèse pour le juriste.
Le juriste garde la décision : il relit les points signalés et vérifie les passages cités, car le modèle peut se tromper avec assurance.
Comment ça marche
Presque tous les grands modèles de langage reposent sur l’architecture Transformer, publiée en 2017 1. Le texte est découpé en tokens ; le réseau calcule, pour chaque position, une probabilité pour chaque token possible à la suite, en retient un, l’ajoute au texte et recommence. On parle de génération autorégressive.
- CollecterD’immenses volumes de texte sont rassemblés et découpés en tokens.
- Pré-entraînerLe réseau apprend à prédire le token suivant.
- AjusterIl est entraîné à suivre des consignes et à dialoguer.
- UtiliserÀ chaque demande, il génère sa réponse token après token.
Les trois premières étapes ont lieu chez l’éditeur du modèle ; la dernière se répète à chaque utilisation.
L’entraînement se fait en deux temps. Le pré-entraînement consiste à prédire la suite de textes sur un corpus immense et non annoté. Viennent ensuite des ajustements, par affinage et par apprentissage par renforcement à partir de retours humains (RLHF), pour que le modèle suive des instructions et se comporte en assistant 4.
L’échelle a changé la nature de l’objet. GPT-3, en 2020, comptait 175 milliards de paramètres et a montré qu’un modèle assez grand pouvait accomplir une tâche à partir de quelques exemples donnés dans la consigne, sans réentraînement 2. En 2023, le rapport technique de GPT-4 décrit un modèle qui accepte aussi des images et qui se classe parmi les 10 % de meilleurs candidats à un examen simulé du barreau 3.
Les limites découlent du même mécanisme : le modèle produit du texte plausible, pas du texte vérifié. Ses connaissances s’arrêtent à sa date de coupure, et tout ce qu’il sait d’une tâche précise doit tenir dans sa fenêtre de contexte.
Ce que ça change pour une entreprise
Un grand modèle de langage est un composant généraliste : le même modèle rédige, classe, extrait des données, traduit et écrit du code, sans projet d’entraînement spécifique. Les usages les plus sûrs sont ceux où un humain relit, ou ceux où l’erreur coûte peu : brouillons, synthèses, tri de demandes, assistance aux développeurs.
Le coût se compte en tokens, à l’entrée comme à la sortie, et varie fortement d’un modèle à l’autre. Les limites sont connues : réponses fausses mais assurées, connaissances figées à une date, résultats variables d’un essai à l’autre. Prévoyez une évaluation sur vos propres cas, et réglez la question des données confiées au fournisseur avant le déploiement.
Idées reçues
- « Un LLM comprend ce qu’il dit comme un humain. »
La question reste débattue. Ce qui est établi : il calcule la suite la plus probable d’un texte, et cette méthode donne des réponses souvent justes, parfois fausses.
- « Il va chercher ses réponses sur Internet. »
Non, sauf si on lui donne un outil de recherche. Par défaut, il répond à partir de ce qu’il a appris pendant l’entraînement.
- « Il apprend de mes conversations en direct. »
Ses paramètres ne changent pas pendant l’usage. La réutilisation de vos échanges pour un entraînement ultérieur dépend des conditions du fournisseur.