Tiering coût/qualité (advisor, delegate, escalate)
Le tiering coût/qualité, c'est arrêter d'envoyer chaque appel au modèle le plus cher et router chacun vers celui qui suffit. Anthropic en nomme trois patterns dans son cookbook « Building Effective AI Agents ». L'advisor : le petit modèle fait le travail et ne consulte le gros que quand il bute, environ une fois par tâche. Le delegate (orchestrateur-ouvriers) : le gros modèle planifie et délègue le gros de l'exécution à des ouvriers moins chers, il devient le manager qui ne tape plus. L'escalate : tu ne montes en gamme que quand la tâche l'exige vraiment. Dans les trois cas, le but est le même, rester proche de la qualité du gros modèle en n'en payant qu'une fraction.
Forces
- Trois patterns nommés et documentés par Anthropic, pas une bidouille maison
- Baisse réelle de la facture sur les tâches mixtes (beaucoup de facile, un peu de dur) sans perte de qualité perceptible
- Activable aujourd'hui dans Claude Code : un sous-agent advisor ou des workers délégués, sans couche d'orchestration maison
Limites
- Sur une tâche uniformément dure, le routage n'apporte rien : tu paieras le gros modèle de toute façon
- Mal calibré (un advisor qui escalade à chaque étape), tu paies le double appel sans jamais toucher l'économie
Pour qui
- Devs qui font tourner des agents et voient la facture grimper sur des étapes majoritairement triviales
- Leads techniques qui doivent arbitrer quel modèle mettre sur quelle étape avant d'industrialiser