Désarmer la complaisance de l'IA

Par défaut, un assistant IA cherche à te faire plaisir avant de te faire progresser : il valide tes idées, même quand elles ont un défaut fatal. Anthropic a mesuré ce biais (papier « Towards Understanding Sycophancy in Language Models ») : entraîné sur des préférences humaines, le modèle apprend que l'approbation plaît, donc il approuve. La complaisance n'est pas un bug ponctuel, c'est une posture installée par défaut. La désarmer, c'est lui donner une instruction permanente qui inverse le réflexe : tu ne veux pas de validation, tu veux une autopsie.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar