Larssen Consulting
Sûreté et règles

Interprétabilité

L’interprétabilité est le domaine de recherche qui vise à comprendre le fonctionnement interne des modèles d’IA, c’est-à-dire à relier leurs calculs à des concepts et à des raisonnements qu’un humain peut lire et vérifier.

  • Lecture : 4 minutes
  • Mis à jour le 8 octobre 2026
  • 4 sources

En clair

Un modèle de langage n’est pas programmé ligne par ligne. Il est entraîné : des milliards de réglages numériques s’ajustent d’eux-mêmes à force d’exemples. Le résultat fonctionne, mais personne n’a écrit les règles qu’il applique. On peut observer ce qui entre et ce qui sort, pas ce qui se passe entre les deux. C’est ce que l’on appelle l’effet boîte noire.

L’interprétabilité joue, pour l’IA, le rôle de l’imagerie médicale pour le cerveau. Interroger un patient renseigne sur ce qu’il dit. Une IRM montre quelles zones s’activent pendant qu’il parle. De même, les chercheurs ne se contentent pas de questionner le modèle : ils regardent quels éléments internes s’activent quand il traite une idée, puis vérifient leur rôle en les amplifiant ou en les coupant.

L’enjeu est pratique. Tant que l’on ne sait pas pourquoi un système répond ce qu’il répond, on ne peut juger sa fiabilité que de l’extérieur, à force de tests, sans pouvoir exclure une mauvaise surprise dans une situation que les tests n’avaient pas prévue. Comprendre le mécanisme permettrait de vérifier, et pas seulement de constater.

Un exemple

Une banque utilise un modèle pour repérer des transactions suspectes. Le taux de détection est bon, mais l’équipe de conformité veut savoir sur quoi le modèle s’appuie. Une analyse des facteurs qui pèsent dans ses décisions montre qu’il accorde un poids excessif au code postal du client, ce qui revient à pénaliser certains quartiers.

Le défaut était invisible dans les chiffres de performance. Une fois repéré, il est corrigé avant la mise en service. Pour les grands modèles de langage, les outils équivalents restent pour l’essentiel au stade de la recherche : une entreprise ne peut pas encore demander ce niveau d’explication pour chaque réponse.

Niveau technique

Comment ça marche

La principale difficulté tient à ce qu’un neurone pris isolément ne correspond presque jamais à un concept unique. Les modèles représentent plus de concepts qu’ils n’ont de neurones, en les codant comme des combinaisons de neurones qui se chevauchent : c’est l’hypothèse de superposition, étudiée en 2022 sur de petits modèles 1. Lire les neurones un par un ne mène donc à rien.

La réponse a été l’apprentissage de dictionnaire. Un autoencodeur parcimonieux (sparse autoencoder) décompose les activations en un grand nombre de directions appelées « features », dont chacune s’active pour un concept identifiable. En mai 2024, Anthropic a appliqué la méthode à un modèle commercial, Claude 3 Sonnet, et en a extrait des millions de features 2. L’une d’elles répondait au Golden Gate Bridge : amplifiée artificiellement, elle conduisait le modèle à ramener presque toutes ses réponses à ce pont. Cette manipulation démontre un lien de cause à effet, et pas une simple corrélation.

L’étape suivante consiste à relier les features entre elles pour reconstituer des circuits, c’est-à-dire les étapes d’un calcul. Des travaux publiés en mars 2025 ont ainsi observé un modèle choisir à l’avance le mot de fin d’un vers avant d’écrire ce vers, enchaîner deux faits pour répondre à une question, ou produire une justification sans rapport avec le calcul réellement effectué 3.

Les limites sont reconnues par les auteurs eux-mêmes : ces méthodes ne saisissent qu’une fraction du calcul total, et l’analyse d’un seul exemple de quelques dizaines de mots demande plusieurs heures de travail humain 3. Une revue collective de 2025 dresse la liste des problèmes ouverts, tant sur les méthodes que sur leur validation 4.

Ce que ça change pour une entreprise

Pour une entreprise, il faut distinguer deux choses. Sur les modèles classiques d’apprentissage automatique, utilisés pour le score de crédit ou la détection de fraude, des méthodes éprouvées indiquent quels facteurs ont pesé dans une décision. Elles permettent de répondre aux exigences d’explication des régulateurs. Sur les grands modèles de langage, l’interprétabilité est encore un sujet de laboratoire, sans outil clé en main.

Cette recherche compte pourtant pour tous les utilisateurs. Elle pourrait permettre, à terme, de vérifier de l’intérieur ce qu’un modèle fait réellement, là où les tests ne voient que son comportement. En attendant, la prudence s’impose sur un point : l’explication qu’un modèle donne de sa propre réponse n’est pas un compte rendu fiable de son calcul. Pour les décisions sensibles, la traçabilité et le contrôle humain restent nécessaires.

Idées reçues

  • « On ne sait rien de ce qui se passe dans un modèle. »

    Le tableau est plus nuancé. On sait identifier des millions de concepts internes et suivre certains raisonnements simples. On est en revanche loin d’une compréhension complète.

  • « Il suffit de demander au modèle d’expliquer son raisonnement. »

    Son explication est un texte produit comme les autres. Les travaux d’interprétabilité ont montré des cas où elle ne correspond pas au calcul effectué.

  • « Un modèle à poids ouverts est transparent. »

    Disposer des milliards de nombres qui composent un modèle ne dit pas ce qu’ils calculent. Avoir accès aux poids permet d’étudier le modèle, cela ne le rend pas lisible.

Sources

  1. Elhage et al., « Toy Models of Superposition », 2022
  2. Templeton et al., « Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet », 2024
  3. Lindsey et al., « On the Biology of a Large Language Model », 2025
  4. Sharkey et al., « Open Problems in Mechanistic Interpretability », 2025

Voir aussi