En clair
Dans la phrase « l’avocat a mangé l’avocat », le même mot désigne une personne puis un fruit. Pour le comprendre, il faut regarder les mots voisins. Le Transformer fait cela de façon systématique : pour chaque mot, il évalue l’importance de tous les autres mots du texte, puis ajuste le sens du mot en conséquence. Ce mécanisme s’appelle l’attention.
Avant 2017, les modèles lisaient un texte mot après mot, comme on suit une ligne du doigt, et perdaient le fil sur les longues phrases. Le Transformer traite tout le texte d’un coup, comme une réunion où chaque participant écouterait tous les autres en même temps. Cette lecture simultanée se prête bien au calcul en parallèle sur des processeurs graphiques, ce qui a permis d’entraîner des modèles beaucoup plus grands.
Un exemple
Un service de traduction doit rendre en français la phrase « The trophy doesn’t fit in the suitcase because it is too big. » Pour traduire « it », il faut savoir s’il désigne le trophée ou la valise : « il est trop grand » ou « elle est trop grande ». L’attention permet au modèle de relier « it » au bon mot de la phrase et de choisir le bon accord.
La traduction est d’ailleurs la tâche sur laquelle l’architecture a été présentée et évaluée en 2017 1.
Comment ça marche
L’article fondateur, « Attention Is All You Need », est signé par huit chercheurs, la plupart chez Google, et propose une architecture qui se passe entièrement de récurrence et de convolution 1. Le mécanisme d’attention existait déjà : il avait été introduit en 2014 pour aider les réseaux récurrents en traduction 2. La nouveauté de 2017 est d’en faire le seul moteur du modèle.
- DécouperLe texte devient une suite de tokens, convertis en vecteurs.
- SituerChaque vecteur reçoit une indication de sa position.
- RelierL’attention pondère, pour chaque token, tous les autres.
- AffinerUn petit réseau retravaille chaque vecteur.
- PrédireLa dernière couche donne la probabilité du token suivant.
Les étapes 3 et 4 se répètent à chaque couche du réseau.
Le texte est converti en tokens, puis en vecteurs, auxquels on ajoute une information de position. Chaque couche combine deux opérations : l’auto-attention, où chaque token calcule un poids pour tous les autres et agrège leur contenu, avec plusieurs « têtes » en parallèle ; puis un petit réseau appliqué à chaque position. Le modèle d’origine empilait six couches et comptait environ 65 millions de paramètres dans sa version de base 1.
L’architecture initiale comportait un encodeur, qui lit, et un décodeur, qui écrit. Deux familles en sont issues : les modèles à encodeur seul, comme BERT en 2018, orientés vers la compréhension 3, et les modèles à décodeur seul, comme la série GPT, qui génèrent du texte token après token. Depuis 2020, le même principe s’applique aux images, découpées en petits carrés traités comme des mots 4.
Sa principale contrainte est le coût : dans sa forme standard, le calcul de l’auto-attention croît avec le carré de la longueur de la séquence 1, ce qui pèse sur les très longs textes.
Ce que ça change pour une entreprise
Vous n’achèterez jamais « un Transformer » : vous utiliserez des modèles qui en sont faits. Connaître l’architecture sert surtout à comprendre leurs traits communs : traitement de longs textes, comptage en tokens, besoin de processeurs graphiques, et capacité à traiter du texte, des images ou du son avec la même mécanique.
Elle éclaire aussi les coûts. Entraîner un grand modèle demande des moyens de calcul hors de portée de la plupart des organisations : en pratique, on utilise un modèle existant, par API ou à poids ouverts, que l’on adapte au besoin. Côté usage, plus l’entrée est longue, plus le calcul est lourd, donc lent et cher.
Idées reçues
- « Transformer et GPT, c’est la même chose. »
GPT est une famille de modèles construits sur cette architecture. Le « T » de GPT signifie d’ailleurs Transformer.
- « Le Transformer imite le cerveau humain. »
C’est une construction mathématique. Le mot « attention » est une image : il désigne un calcul de pondération, pas une conscience.
- « C’est une technologie réservée au texte. »
La même architecture traite aussi des images, du son et de la vidéo.
Sources
- Vaswani et al., « Attention Is All You Need », 2017
- Bahdanau, Cho et Bengio, « Neural Machine Translation by Jointly Learning to Align and Translate », 2014
- Devlin et al., « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding », 2018
- Dosovitskiy et al., « An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale », 2020