En clair
Un modèle de langage est bien élevé par son entraînement, mais il reste imprévisible : il peut se tromper, se laisser manipuler ou sortir de son rôle. Compter sur sa seule bonne conduite reviendrait à construire une route de montagne sans glissière, en se fiant au talent des conducteurs. Les garde-fous sont ces glissières. Ils ne conduisent pas à la place du modèle, ils limitent les dégâts quand il dévie.
Ils se placent à trois endroits. À l’entrée, on examine la demande : est-elle dans le périmètre, contient-elle une tentative de manipulation ou des données sensibles ? À la sortie, on vérifie la réponse avant de l’afficher : contenu interdit, information confidentielle, format incorrect. Autour des actions, on fixe des limites : quels outils, quels montants, quelles opérations exigent l’accord d’un humain.
Le point essentiel est l’indépendance. Un garde-fou est un contrôle distinct du modèle, qui continue de fonctionner quand celui-ci a été trompé. Demander poliment au modèle de ne pas dépasser un montant n’est pas un garde-fou. Faire refuser par le logiciel toute opération au-delà de ce montant en est un, car aucune phrase habile adressée au modèle ne peut lever ce blocage.
Un exemple
Un assureur ouvre à ses clients un assistant en ligne. Un premier filtre écarte les demandes hors sujet et masque les numéros de carte bancaire saisis par erreur. La réponse du modèle passe ensuite par un second contrôle, qui bloque tout ce qui ressemble à un avis médical ou à une promesse d’indemnisation.
Pour les actions, les règles sont écrites dans le code et non dans les consignes : l’assistant peut consulter un contrat, mais une modification de coordonnées bancaires déclenche toujours une vérification par un conseiller. Chaque blocage est journalisé, ce qui permet d’ajuster les seuils quand trop de demandes légitimes sont refusées.
Comment ça marche
Les garde-fous les plus répandus sont des classifieurs : des modèles, souvent plus petits que le modèle principal, qui étiquettent une entrée ou une sortie selon une grille de risques. Llama Guard, publié par Meta fin 2023, est un modèle de langage affiné pour classer les demandes et les réponses selon une taxonomie que l’on peut adapter 1. D’autres outils, comme NeMo Guardrails de Nvidia, permettent de programmer des « rails » qui encadrent le déroulement d’un dialogue 2.
- Filtrer l’entréeLa demande est contrôlée avant d’atteindre le modèle.
- GénérerLe modèle répond dans le cadre fixé par ses consignes.
- VérifierLa réponse est contrôlée avant d’être affichée ou utilisée.
- Encadrer l’actionPermissions, plafonds et validation humaine s’appliquent aux outils.
Ces contrôles ont un coût mesurable. Anthropic a publié en 2025 les résultats de classifieurs entraînés à partir de règles écrites en langage naturel. Au cours de plus de 3 000 heures de tests adverses, aucun contournement universel n’a été trouvé sur un prototype. En contrepartie, la version évaluée augmentait les refus de 0,38 point sur le trafic réel et le coût de calcul de 23,7 % 3.
S’y ajoutent des contrôles déterministes, sans modèle : validation de la sortie par rapport à un schéma, listes d’outils autorisés, plafonds de dépense ou de nombre d’étapes, exécution dans un environnement isolé, validation humaine avant une action irréversible. L’OWASP recommande de combiner ces mesures, aucune ne suffisant seule face à l’injection de prompt 4. C’est le principe de la défense en profondeur : plusieurs couches imparfaites, dont les failles ne se recouvrent pas.
Ce que ça change pour une entreprise
Les garde-fous sont ce qui rend un déploiement défendable : ils transforment « le modèle se comporte bien en général » en règles vérifiables et traçables. Ils répondent à des risques concrets : propos engageant l’entreprise, fuite de données personnelles, action non autorisée. Ils fournissent aussi des journaux, utiles en cas d’incident et pour les obligations de supervision humaine prévues par la réglementation.
Chaque couche se paie. Un classifieur ajoute de la latence et du coût à chaque échange. Un filtre trop strict refuse des demandes légitimes et dégrade le service, un filtre trop lâche laisse passer ce qu’il devait arrêter. Il faut donc régler les seuils sur des données réelles, suivre les taux de blocage et prévoir une voie de recours vers un humain. Les garde-fous réduisent le risque sans l’annuler : ils complètent les tests adverses, ils ne les remplacent pas.
Idées reçues
- « Les consignes du prompt système sont des garde-fous. »
Ce sont des instructions, que le modèle suit le plus souvent mais peut ignorer ou se voir retourner. Un garde-fou est un contrôle séparé, qui ne dépend pas de la bonne volonté du modèle.
- « Avec des garde-fous, le système est sûr. »
Aucun filtre n’arrête tout. Ils abaissent la fréquence et la gravité des incidents, à condition d’être testés et ajustés régulièrement.
- « Le fournisseur du modèle s’en charge. »
Il protège contre les abus généraux. Les règles propres à votre métier, à vos données et à vos outils restent à définir par vous.
Sources
- Inan et al., « Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations », 2023
- Rebedea et al., « NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails », 2023
- Sharma et al., « Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming », 2025
- OWASP, « LLM01:2025 Prompt Injection », OWASP Top 10 for LLM Applications, 2025