En clair
Un professeur expérimenté a mis des années à maîtriser sa discipline. Son élève n’a pas besoin de refaire tout le chemin : il apprend à partir des explications du professeur, déjà triées et mises en forme. La distillation applique cette idée aux modèles. Un grand modèle, le professeur, répond à un très grand nombre de questions. Un petit modèle, l’élève, s’entraîne à donner les mêmes réponses.
L’élève apprend mieux ainsi que seul, parce que le professeur lui transmet plus que la bonne réponse : il lui transmet ses hésitations. Devant la photo d’un chien, le professeur ne dit pas seulement « chien ». Il indique aussi que l’image ressemble un peu à un loup et pas du tout à une voiture. Ces nuances renseignent l’élève sur la façon dont les choses se ressemblent.
Le résultat est un modèle qui tient dans moins de mémoire, répond plus vite et coûte moins cher à utiliser. Il perd un peu en qualité, surtout sur les demandes rares ou difficiles. C’est l’une des techniques employées pour fabriquer des modèles légers, capables de tourner sur du matériel modeste.
Un exemple
Une plateforme de commerce en ligne classe chaque jour des millions de messages de clients par motif : retard, remboursement, produit défectueux. Un grand modèle le fait très bien, mais la facture et le temps de réponse sont trop élevés à ce volume. L’équipe lui fait classer cent mille messages, puis entraîne un petit modèle à reproduire ces classements.
Le petit modèle traite ensuite le flux quotidien pour une fraction du coût, et les messages sur lesquels il hésite sont renvoyés au grand modèle. Avant de procéder, l’équipe a vérifié que les conditions d’utilisation du fournisseur autorisaient cet usage.
Comment ça marche
La méthode est formalisée en 2015 par Geoffrey Hinton, Oriol Vinyals et Jeff Dean 1. Un modèle de classification produit pour chaque entrée une distribution de probabilité sur toutes les réponses possibles. L’élève est entraîné à reproduire cette distribution entière, appelée « cibles douces », et non la seule bonne réponse. Les faibles probabilités attribuées aux mauvaises réponses renseignent sur la manière dont le professeur généralise.
- ChoisirSélectionner un grand modèle performant, le professeur.
- GénérerLe professeur répond à un grand nombre d’exemples.
- EntraînerLe petit modèle apprend à reproduire ces réponses.
- VérifierComparer élève et professeur sur des cas jamais vus.
Pour rendre ces nuances visibles, on augmente la température de la fonction qui calcule les probabilités : la distribution s’adoucit et les petites valeurs pèsent davantage. La même température sert à entraîner l’élève, qui revient ensuite à une température de 1 1. Un exemple connu est DistilBERT, en 2019 : 40 % plus petit que BERT et 60 % plus rapide, il conserve 97 % de ses capacités de compréhension du langage 2.
Avec les modèles génératifs, la distillation prend souvent une forme plus simple : l’élève est entraîné directement sur des textes produits par le professeur, sans accès à ses probabilités internes. Il suffit alors de pouvoir interroger le professeur. Des fournisseurs encadrent donc cette pratique par contrat : les conditions commerciales d’Anthropic, par exemple, interdisent d’utiliser ses services pour entraîner des modèles concurrents 3. La distillation se distingue de la quantification, qui réduit la précision des poids sans changer de modèle.
Ce que ça change pour une entreprise
La distillation répond à un problème de volume. Quand une tâche bien délimitée est exécutée des millions de fois, un petit modèle distillé peut réduire nettement le coût et le temps de réponse, et parfois tourner sur un serveur modeste ou sur un appareil mobile. Les entreprises en profitent surtout indirectement, en choisissant dans la gamme d’un fournisseur le modèle léger qui suffit à leur besoin.
La pratiquer soi-même demande des compétences d’entraînement, un jeu d’exemples représentatif et une évaluation sérieuse. L’élève hérite des erreurs et des biais du professeur et reste en retrait sur les cas complexes ou inhabituels. Il est figé : si la tâche évolue, il faut recommencer. Enfin, distiller le modèle d’un tiers à partir de ses réponses peut être interdit par ses conditions d’utilisation 3.
Idées reçues
- « Un modèle distillé est aussi bon que l’original. »
Il s’en approche sur les tâches courantes, mais perd en qualité sur les cas rares ou difficiles. L’écart se mesure, il ne se suppose pas.
- « Distiller, c’est compresser un fichier. »
Ce n’est pas une compression : un nouveau modèle, plus petit, est entraîné à imiter le premier.
- « La distillation copie le modèle. »
L’élève ne reçoit pas les poids du professeur. Il apprend de ses réponses et n’en reproduit qu’une partie du comportement.