Larssen Consulting
Modèles de langage

Token

Un token est l’unité de texte que manipule un modèle de langage, souvent un mot court ou un morceau de mot, et c’est aussi l’unité dans laquelle se mesurent sa capacité, sa vitesse et sa facture.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 4 sources

En clair

Un modèle de langage ne lit ni des lettres ni des mots entiers. Il découpe le texte en petits morceaux, les tokens, un peu comme on découpe un mot en syllabes. Un mot courant tient souvent en un seul token ; un mot rare ou long, comme « anticonstitutionnellement », en demande plusieurs. La ponctuation et les espaces comptent aussi.

Pourquoi ce détour ? Avec un nombre limité de morceaux, on peut écrire n’importe quel mot, y compris un nom propre inconnu ou une faute de frappe : c’est un jeu de briques. Le modèle reçoit donc une suite de briques numérotées, et il répond en produisant de nouvelles briques, une par une, que l’application retraduit en texte.

Le token est enfin une unité de compte. La longueur maximale d’une demande, la vitesse d’affichage de la réponse et le prix facturé s’expriment tous en tokens. Savoir estimer un volume en tokens, c’est savoir lire un devis : sans cet ordre de grandeur, impossible de comparer deux modèles ou de prévoir un budget.

Un exemple

Une entreprise veut résumer automatiquement 2 000 comptes rendus de réunion par mois. Avant de choisir un modèle, l’équipe mesure la taille réelle d’un échantillon avec l’outil de comptage du fournisseur, puis multiplie par le volume mensuel et par le prix au million de tokens, en entrée et en sortie.

Elle constate au passage que le même texte ne donne pas le même nombre de tokens d’un modèle à l’autre : le budget se recalcule à chaque changement de modèle.

Niveau technique

Comment ça marche

La plupart des tokeniseurs actuels découpent en sous-mots. La méthode la plus répandue, le codage par paires d’octets (byte pair encoding, BPE), a été adaptée à la traduction automatique en 2015 : on part des caractères et on fusionne de proche en proche les paires les plus fréquentes, jusqu’à obtenir un vocabulaire de taille fixée 1. Les mots fréquents deviennent un seul token, les mots rares se décomposent.

  1. DécouperLe tokeniseur fragmente le texte en morceaux connus de son vocabulaire.
  2. NuméroterChaque morceau est remplacé par son numéro.
  3. CalculerLe modèle prédit le numéro du token suivant.
  4. ReconvertirLes numéros produits sont retraduits en texte lisible.

Le modèle ne voit jamais de lettres : seulement des numéros de tokens.

Chaque token porte un numéro. Le modèle convertit ce numéro en vecteur, effectue ses calculs, puis attribue une probabilité à chaque token du vocabulaire pour choisir le suivant. Les ordres de grandeur dépendent du modèle et de la langue : Anthropic indique environ 3,5 caractères anglais par token pour Claude 2, Google environ 4 caractères pour Gemini, soit 60 à 80 mots anglais pour 100 tokens 3.

Le tokeniseur change d’un modèle à l’autre, parfois d’une génération à l’autre : Anthropic signale que son tokeniseur le plus récent produit environ 30 % de tokens en plus que le précédent pour un même texte 4. Les contenus non textuels sont eux aussi convertis en tokens : dans la documentation de Gemini, une petite image compte pour 258 tokens et une seconde de son pour 32 tokens 3.

Ce que ça change pour une entreprise

Le token est l’unité de facturation des modèles accessibles par API : on paie les tokens envoyés et les tokens générés, ces derniers étant en général facturés plus cher. Trois leviers réduisent la note : raccourcir ce que l’on envoie, limiter la longueur des réponses et choisir un modèle plus petit quand la tâche le permet.

Les estimations en nombre de mots sont trompeuses : le ratio dépend de la langue, du type de contenu et du modèle. Mesurez sur vos propres documents avec l’outil de comptage du fournisseur, et prévoyez une marge : avec les modèles de raisonnement, la réflexion interne est elle aussi facturée en tokens de sortie.

Idées reçues

  • « Un token, c’est un mot. »

    Pas exactement : c’est souvent un fragment de mot. Un texte compte en général plus de tokens que de mots.

  • « Le comptage est le même partout. »

    Chaque famille de modèles a son tokeniseur. Le même texte peut représenter sensiblement plus ou moins de tokens selon le modèle.

  • « Les tokens ne concernent que le texte. »

    Images, sons et vidéos sont aussi convertis en tokens, et comptés comme tels.

Sources

  1. Sennrich, Haddow et Birch, « Neural Machine Translation of Rare Words with Subword Units », 2015
  2. Anthropic, glossaire de la documentation Claude
  3. Google, documentation de l’API Gemini, « Understand and count tokens »
  4. Anthropic, documentation Claude, « Token counting »

Voir aussi