En clair
La vie d’un modèle a deux temps. L’entraînement ressemble aux années d’études : long, coûteux, fait en amont. L’inférence, c’est l’exercice du métier : chaque fois que vous posez une question à un assistant, le modèle fait de l’inférence. Comme un médecin en consultation, il mobilise ce qu’il a appris pour traiter votre cas, mais il ne retourne pas à l’université entre deux patients.
Ce point surprend souvent : pendant l’inférence, le modèle n’apprend rien. Ses réglages internes sont figés. S’il semble se souvenir du début de la conversation, c’est parce que l’application lui renvoie tout l’échange à chaque message. Une fois la conversation fermée, il n’en reste rien dans le modèle lui-même : il aborde la suivante sans aucun souvenir.
L’inférence est aussi ce que vous payez. Chaque réponse demande un calcul sur des machines spécialisées, et ce calcul est facturé à l’usage : plus le texte lu et écrit est long, plus la réponse coûte et plus elle tarde. C’est la ligne de dépense qui grandit avec le nombre d’utilisateurs.
Un exemple
Une enseigne déploie un assistant pour son service client. Chaque message d’un client déclenche une inférence : le modèle lit les consignes, l’historique de la conversation et la question, puis rédige sa réponse morceau par morceau. Le client voit le texte s’afficher progressivement.
À dix mille conversations par jour, la facture dépend directement de la longueur des consignes et des réponses. L’équipe raccourcit les consignes, met en cache la partie qui ne change jamais et confie les questions simples à un modèle plus petit : le coût baisse sans que le client voie la différence.
Comment ça marche
À l’inférence, les poids du modèle ne sont pas modifiés : il n’y a ni calcul d’erreur ni rétropropagation, seulement un passage de l’entrée à travers le réseau. Un modèle de langage génère de façon autorégressive : il calcule une distribution de probabilité sur le token suivant, en choisit un, l’ajoute à la séquence et recommence 1. Une réponse de 500 tokens demande donc 500 passages successifs.
- DécouperLe texte d’entrée est converti en tokens.
- CalculerLe réseau estime la probabilité de chaque token suivant possible.
- ChoisirUn token est tiré selon ces probabilités.
- RépéterLe token rejoint la séquence, et le calcul reprend.
La boucle s’arrête quand le modèle produit un signal de fin ou atteint la longueur maximale.
Deux mesures décrivent la performance : la latence, notamment le délai avant le premier token, et le débit, en tokens par seconde. Les fournisseurs facturent séparément les tokens d’entrée et les tokens de sortie, les seconds étant plus chers : cinq fois plus dans la grille tarifaire d’Anthropic, par exemple 2.
Plusieurs techniques réduisent le coût. La quantification représente les poids avec moins de précision, par exemple par des entiers de 8 bits au lieu de nombres à virgule 3. Le traitement par lots regroupe plusieurs demandes dans le même calcul. La mise en cache évite de retraiter une partie d’entrée déjà vue. En combinant ce type d’optimisations, une équipe de Google a obtenu 29 millisecondes par token sur un modèle de 540 milliards de paramètres 4.
Ce que ça change pour une entreprise
Pour une entreprise, l’IA est presque toujours une dépense d’inférence : on n’entraîne pas le modèle, on paie son utilisation, au token ou par abonnement. Les leviers sont concrets : choisir le plus petit modèle qui suffit, raccourcir les entrées, mettre en cache ce qui se répète, traiter en différé ce qui n’est pas urgent. Chez Anthropic, par exemple, le traitement différé par lots est facturé moitié prix 2.
L’autre choix porte sur le lieu du calcul. Passer par le service d’un fournisseur évite d’acheter du matériel, mais les données quittent l’entreprise et le prix dépend d’un tiers. Héberger soi-même un modèle donne la maîtrise, au prix de GPU à acquérir ou à louer, d’une équipe pour l’exploiter et d’une capacité à dimensionner pour les pics d’usage.
Idées reçues
- « Le modèle apprend de mes conversations pendant que je l’utilise. »
L’inférence ne modifie pas le modèle. Vos échanges ne peuvent servir qu’à un entraînement ultérieur, si les conditions du service le prévoient.
- « Le coût de l’IA, c’est surtout l’entraînement. »
Pour l’entreprise utilisatrice, c’est l’inverse : l’entraînement est financé par le fournisseur, et la facture qu’elle reçoit est une facture d’inférence.
- « La même question donne toujours la même réponse. »
Le token suivant est tiré au sort selon des probabilités. Deux inférences identiques peuvent donc produire deux textes différents.
Sources
- Vaswani et al., « Attention Is All You Need », 2017
- Anthropic, « Pricing », documentation officielle de la plateforme Claude
- Jacob et al., « Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference », 2017
- Pope et al., « Efficiently Scaling Transformer Inference », 2022