En clair
Avant d’apprendre un métier, on apprend à lire, à écrire, à compter, et l’on accumule une culture générale. Le pré-entraînement joue ce rôle pour un modèle. On lui fait lire une quantité de textes qu’aucun humain ne pourrait parcourir en une vie, sur tous les sujets, avec un seul exercice répété un nombre immense de fois : deviner le mot qui suit.
L’exercice paraît pauvre, mais pour bien deviner la suite d’un texte, il faut en savoir beaucoup. Compléter « la capitale de l’Australie est » demande de la géographie. Compléter une démonstration demande de la logique. Compléter un dialogue demande de saisir une intention. À force de prédire, le modèle absorbe la grammaire, des faits, des styles et des façons de raisonner, sans que personne ne les lui ait enseignés un par un.
Le résultat n’est pas encore un assistant. C’est un modèle de base, qui sait prolonger un texte mais pas forcément répondre à une question ni suivre une consigne. Les étapes suivantes lui donnent ce comportement. Le « P » de GPT signifie d’ailleurs « pré-entraîné » : le terme est au cœur de ces modèles.
Un exemple
Un éditeur de logiciels veut un assistant pour ses clients. Il ne pré-entraîne rien : il part d’un modèle déjà pré-entraîné par un laboratoire, qui maîtrise le français et le vocabulaire courant de l’informatique. Son travail porte sur la suite : rédiger des consignes, brancher sa documentation, éventuellement affiner le modèle sur ses propres échanges de support.
C’est le schéma général. Le pré-entraînement est réalisé par quelques acteurs disposant des moyens nécessaires, et de très nombreuses entreprises réutilisent son résultat.
Comment ça marche
Le pré-entraînement est auto-supervisé : les données n’ont pas besoin d’être annotées par des humains, car l’exercice se construit à partir du texte lui-même. Deux objectifs dominent. La modélisation autorégressive, celle des modèles GPT, consiste à prédire le token suivant à partir des précédents 1. La modélisation masquée, celle de BERT, consiste à retrouver des tokens cachés dans une phrase, 15 % d’entre eux dans l’article d’origine 2.
- CollecterRassembler et nettoyer un très grand corpus de textes.
- PrédireLe modèle devine le token suivant d’un extrait.
- CorrigerChaque erreur ajuste légèrement ses paramètres.
- AffinerLe modèle de base apprend ensuite à suivre des instructions.
Les étapes 2 et 3 forment une boucle, qui occupe l’essentiel du temps de calcul.
L’approche s’impose en 2018. Le premier GPT est pré-entraîné sur un corpus de plus de 7 000 livres, puis affiné pour chaque tâche 1. BERT l’est sur 3,3 milliards de mots, tirés de livres et de la version anglaise de Wikipédia 2. En 2020, GPT-3, avec 175 milliards de paramètres, montre qu’un modèle pré-entraîné assez grand peut accomplir de nombreuses tâches à partir de quelques exemples donnés dans la consigne, sans affinage 3.
Le pré-entraînement concentre l’essentiel du coût de calcul. La qualité des prédictions progresse de façon régulière avec la taille du modèle, le volume de données et la puissance de calcul engagée, ce qui a poussé les laboratoires à changer d’échelle 4. Le modèle obtenu est ensuite affiné sur des démonstrations et des préférences humaines pour suivre des instructions 5. Sa date de coupure est celle où la collecte des données s’est arrêtée.
Ce que ça change pour une entreprise
Le pré-entraînement explique l’économie du secteur. Son coût, en calcul, en données et en ingénieurs, n’est à la portée que de quelques laboratoires et grandes entreprises. Les autres acteurs construisent sur ces modèles de base, par abonnement, par interface de programmation ou en téléchargeant des modèles à poids ouverts. Pour une entreprise, pré-entraîner son propre modèle n’est presque jamais le bon projet.
Ce qui a été fixé à cette étape s’impose ensuite à l’utilisateur : la date de coupure des connaissances, les langues et domaines bien ou mal couverts, les biais présents dans les textes. S’y ajoutent des questions juridiques sur l’origine des données. Le règlement européen impose aux fournisseurs de modèles à usage général de publier un résumé suffisamment détaillé des contenus utilisés pour l’entraînement 6.
Idées reçues
- « Le modèle garde une copie des textes qu’il a lus. »
Il n’en conserve que des régularités, inscrites dans ses paramètres. Il n’a pas d’archive à consulter, même s’il peut lui arriver de restituer certains passages mot pour mot.
- « Un modèle pré-entraîné est prêt à l’emploi. »
Il sait prolonger un texte. C’est l’affinage qui en fait un assistant capable de suivre une consigne.
- « Chaque entreprise devrait pré-entraîner un modèle sur ses données. »
Le coût est hors de portée et le gain incertain. Les consignes, la recherche documentaire et l’affinage répondent à presque tous les besoins.
Sources
- Radford et al., « Improving Language Understanding by Generative Pre-Training », OpenAI, 2018
- Devlin et al., « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding », 2018
- Brown et al., « Language Models are Few-Shot Learners », 2020
- Kaplan et al., « Scaling Laws for Neural Language Models », 2020
- Ouyang et al., « Training language models to follow instructions with human feedback », 2022
- Règlement (UE) 2024/1689 sur l’intelligence artificielle, article 53, EUR-Lex