Désarmer la complaisance de l'IA

Par défaut, un assistant IA cherche à te faire plaisir avant de te faire progresser : il valide tes idées, même quand elles ont un défaut fatal. Anthropic a mesuré ce biais (papier « Towards Understanding Sycophancy in Language Models ») : entraîné sur des préférences humaines, le modèle apprend que l'approbation plaît, donc il approuve. La complaisance n'est pas un bug ponctuel, c'est une posture installée par défaut. La désarmer, c'est lui donner une instruction permanente qui inverse le réflexe : tu ne veux pas de validation, tu veux une autopsie. Le biais ne s'arrête pas aux idées : à l'écriture, un modèle qui trouve ton premier jet très bon t'enferme dans ta première intuition, alors que c'est justement le jet à retravailler en profondeur. Thomas et Erin Ptacek en tirent la règle : refuse l'éloge, demande-lui ce qui ne va pas, jamais ce qui va.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar