En clair
Comment savoir si un modèle est meilleur qu’un autre ? En leur faisant passer le même examen. Un benchmark, c’est cela : un ensemble fixe de questions ou d’exercices, avec un barème. Chaque modèle obtient une note, et les notes se comparent. Il en existe pour les connaissances générales, les mathématiques, la programmation, la lecture d’images ou la capacité à mener une tâche longue.
Comme tout examen, il a ses travers. Un élève peut avoir eu les sujets à l’avance : un modèle peut avoir croisé les questions pendant son entraînement, puisqu’elles sont publiées sur le web. Un élève peut bachoter sans comprendre : un modèle peut être optimisé pour un test précis. Et une bonne note au permis de conduire ne dit pas comment quelqu’un conduira de nuit, sous la pluie, sur une route inconnue.
Un benchmark est donc un indicateur utile, pas un verdict. Il dit comment un modèle se comporte sur ce test précis. Pour savoir ce qu’il vaut sur vos dossiers, avec vos consignes et vos contraintes, le seul examen qui compte est celui que vous construisez à partir de vos propres cas.
Un exemple
Une direction informatique hésite entre trois modèles pour un assistant de support interne. Les classements publics placent le modèle A en tête. L’équipe réunit deux cents demandes réelles déjà traitées, avec la bonne réponse validée par les experts, et les soumet aux trois modèles.
Sur ce test maison, le modèle B, plus petit et moins cher, fait jeu égal avec A et respecte mieux le format demandé. Le jeu de deux cents cas est conservé : il servira à réévaluer chaque nouvelle version avant de l’adopter.
Comment ça marche
Un benchmark associe un jeu de données, une tâche et une métrique : taux de bonnes réponses, taux de problèmes résolus, note attribuée par des juges. Certains ont orienté la recherche pendant des années. Le concours ImageNet, organisé chaque année à partir de 2010, a servi d’étalon à la reconnaissance d’images 1. MMLU, en 2020, évalue les connaissances d’un modèle dans 57 matières, des mathématiques élémentaires au droit 2.
Les benchmarks récents mesurent des tâches plus proches du travail réel. SWE-bench, en 2023, soumet au modèle 2 294 problèmes tirés de 12 projets de code publics : il doit modifier le code pour résoudre un problème signalé par des utilisateurs. À sa publication, le meilleur modèle en résolvait 1,96 % 3. Quand les scores approchent du maximum, le benchmark est dit saturé : il ne distingue plus les modèles et doit être remplacé.
Deux faiblesses sont documentées. La contamination : les questions d’un test public finissent dans les données d’entraînement. Des chercheurs ont rédigé une version inédite d’un test de mathématiques de niveau scolaire : certains modèles y perdent jusqu’à 8 % de précision, signe d’une mémorisation partielle, alors que les modèles les plus avancés y résistent bien 4. La fragilité : un score vaut pour un jeu de données précis. Sur un nouveau jeu de test construit selon la méthode d’origine d’ImageNet, la précision des modèles baisse de 11 à 14 % 5.
Ce que ça change pour une entreprise
Les scores publiés par les fournisseurs servent à présélectionner, pas à décider. Ils indiquent un niveau général et une tendance, mais sont mesurés dans des conditions choisies par celui qui les publie, sur des tâches qui ne sont pas les vôtres. Un écart de quelques points entre deux modèles peut n’avoir aucune conséquence visible en usage réel.
L’investissement utile est un jeu d’évaluation interne : quelques dizaines à quelques centaines de cas réels, avec la réponse attendue et un barème. Sa constitution demande du temps d’experts métier, et il doit rester confidentiel et être renouvelé. En échange, il permet de comparer des modèles, de valider une nouvelle version et de mesurer l’effet d’un changement de consignes, sur ce qui compte pour l’entreprise.
Idées reçues
- « Le modèle en tête du classement est le meilleur pour mon usage. »
Il est le meilleur sur ce test. Sur vos tâches, un modèle moins bien classé, plus rapide ou moins cher peut convenir autant.
- « Un score est une mesure objective. »
Il dépend du test, des consignes employées et des réglages. Le même modèle peut obtenir des scores différents selon la façon dont on l’évalue.
- « Un bon score prouve que le modèle comprend. »
Il prouve qu’il réussit ce test. Si les questions figuraient dans ses données d’entraînement, une partie du score relève de la mémoire.
Sources
- Russakovsky et al., « ImageNet Large Scale Visual Recognition Challenge », 2014
- Hendrycks et al., « Measuring Massive Multitask Language Understanding », 2020
- Jimenez et al., « SWE-bench: Can Language Models Resolve Real-World GitHub Issues? », 2023
- Zhang et al., « A Careful Examination of Large Language Model Performance on Grade School Arithmetic », 2024
- Recht et al., « Do ImageNet Classifiers Generalize to ImageNet? », 2019