Larssen Consulting
Les bases

Paramètres

poids du modèle

Les paramètres, ou poids, sont les nombres internes d’un modèle d’IA que l’entraînement ajuste un à un ; pris ensemble, ils contiennent tout ce que le modèle a appris et déterminent chacune de ses réponses.

  • Lecture : 4 minutes
  • Mis à jour le 8 octobre 2026
  • 7 sources

En clair

Imaginez une table de mixage dotée de milliards de curseurs. Chaque curseur est un paramètre : un simple nombre. Pendant l’entraînement, chacun est déplacé un tout petit peu, un très grand nombre de fois, jusqu’à ce que le modèle réponde correctement. Une fois l’entraînement terminé, les curseurs ne bougent plus. Le modèle que vous utilisez est cette position figée.

Il n’y a rien d’autre dans un modèle : ni base de données, ni textes rangés quelque part. Ce qu’il « sait » est réparti dans l’ensemble de ces nombres, un peu comme un souvenir est réparti dans un cerveau sans occuper une case précise. C’est pourquoi on ne peut pas ouvrir un modèle pour y corriger un fait ou en effacer un.

Quand on lit qu’un modèle compte « 7 milliards de paramètres », on parle de sa taille. Plus il en a, plus il peut retenir de nuances, et plus il faut de mémoire et de calcul pour le faire tourner. C’est une indication de gabarit, comme la cylindrée d’un moteur, pas une note de qualité.

Un exemple

Une entreprise veut installer un modèle de langage sur ses propres serveurs pour traiter des documents confidentiels. Le premier chiffre à regarder est le nombre de paramètres : il indique la mémoire nécessaire. Un modèle de 7 milliards de paramètres, stocké avec 2 octets par paramètre, occupe environ 14 gigaoctets.

Un modèle dix fois plus gros demandera dix fois plus de mémoire, donc davantage de matériel et un budget en conséquence. Le choix de la taille est un arbitrage entre qualité, vitesse et coût.

Niveau technique

Comment ça marche

Dans un réseau de neurones, les paramètres sont les poids des connexions et les biais de chaque neurone, regroupés en grandes matrices. Ils se distinguent des hyperparamètres, choisis par les ingénieurs avant l’entraînement (nombre de couches, vitesse d’apprentissage), et des réglages d’utilisation comme la température, qui ne modifient pas le modèle.

Les ordres de grandeur ont changé très vite. AlexNet, en 2012, comptait 60 millions de paramètres 1. Le Transformer d’origine, en 2017, en comptait 65 millions dans sa version de base et 213 millions dans sa grande version 2. BERT, en 2018, 110 et 340 millions selon la version 3. GPT-3, en 2020, 175 milliards 4.

Chaque paramètre est un nombre à virgule, stocké le plus souvent sur 16 ou 32 bits. La mémoire nécessaire se calcule donc simplement : nombre de paramètres multiplié par la taille de chacun. La quantification réduit cette précision, par exemple en représentant les poids par des entiers de 8 bits, pour économiser la mémoire et accélérer le calcul, au prix d’un risque de perte de qualité qu’il faut mesurer 5.

Plus de paramètres ne signifie pas mécaniquement un meilleur modèle. La qualité dépend aussi des données et de la méthode d’entraînement : en 2022, les réponses d’un modèle de 1,3 milliard de paramètres, ajusté à l’aide de retours humains, ont été préférées par des évaluateurs à celles de GPT-3 et de ses 175 milliards 6. Les paramètres ne sont pas non plus une archive des données d’entraînement, même si des chercheurs ont réussi à faire restituer mot pour mot à un modèle des centaines de passages qu’il avait vus 7.

Ce que ça change pour une entreprise

Le nombre de paramètres commande trois choses : le matériel nécessaire, la vitesse de réponse et le prix. Les fournisseurs proposent en général plusieurs tailles de modèle, à des tarifs très différents. Pour une tâche simple et répétitive, comme classer des courriels ou extraire des champs d’un formulaire, un petit modèle suffit souvent et répond plus vite.

Les poids sont aussi un actif. Pour un fournisseur, ils concentrent tout l’investissement d’entraînement, d’où le soin mis à les protéger. Pour une entreprise qui héberge un modèle à poids ouverts, ce sont des fichiers volumineux à stocker, sécuriser et mettre à jour. Et comme le savoir du modèle est figé dans ses paramètres, toute information nouvelle doit lui être fournie au moment de la question.

Idées reçues

  • « Plus un modèle a de paramètres, meilleur il est. »

    La taille aide, mais les données et la méthode d’entraînement comptent autant. Un modèle plus petit et mieux entraîné peut être préféré à un modèle bien plus gros.

  • « Les paramètres contiennent une copie des textes d’entraînement. »

    Ils contiennent des régularités statistiques, pas une archive. Des chercheurs ont toutefois réussi à faire restituer mot pour mot à un modèle des passages de ses données d’entraînement.

  • « Les paramètres se règlent dans l’interface. »

    Ce que l’on règle à l’usage, comme la température, n’est pas un paramètre du modèle. Les poids, eux, ne changent pas entre deux questions.

Sources

  1. Krizhevsky, Sutskever et Hinton, « ImageNet Classification with Deep Convolutional Neural Networks », NeurIPS, 2012
  2. Vaswani et al., « Attention Is All You Need », 2017
  3. Devlin et al., « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding », 2018
  4. Brown et al., « Language Models are Few-Shot Learners », 2020
  5. Jacob et al., « Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference », 2017
  6. Ouyang et al., « Training language models to follow instructions with human feedback », 2022
  7. Carlini et al., « Extracting Training Data from Large Language Models », 2020

Voir aussi