Guardrails (garde-fous d'un système LLM)
Les contrôles posés autour du modèle pour empêcher une sortie inacceptable de partir en production : filtrage de l'entrée, vérification de la sortie contre un schéma, refus des sujets hors périmètre, détection d'injection de prompt. Le modèle n'est pas le garde-fou de lui-même : c'est la couche autour de lui qui décide de ce qui passe et de ce qui est bloqué.
Forces
- Vit dans ton code, donc hors de portée d'une injection de prompt
- La validation par schéma attrape aussi les erreurs de format, pas seulement les abus
Limites
- Trop de contrôles et le système refuse des demandes légitimes : le réglage se paie en faux positifs
Pour qui
- Cadrer un agent en production dont la sortie est lue par des utilisateurs