Speculative decoding
Un modèle écrit un mot à la fois, et chaque mot demande de relire tout ce qui précède : c'est lent par construction. Le speculative decoding inverse la charge. Un petit modèle rapide rédige plusieurs mots d'avance, puis le gros modèle les relit tous en une seule passe et garde le plus long début qu'il aurait écrit lui-même. Le reste est jeté. Tu obtiens exactement le texte que le gros modèle aurait produit seul, en deux à trois fois moins d'allers-retours.
Forces
- La sortie est identique à celle du gros modèle seul : ce mécanisme accélère sans dégrader
- Rien à changer de ton côté : le gain arrive par le fournisseur, sans toucher à tes prompts
Limites
- Le gain dépend de la prévisibilité du texte : sur une réponse très technique où le petit modèle se trompe souvent, ses propositions sont jetées et l'accélération fond
- Il faut faire tourner deux modèles au lieu d'un : la latence baisse, la mémoire occupée monte
Pour qui
- Comprendre d'où vient un gain de vitesse annoncé par un fournisseur, avant de changer de modèle pour la mauvaise raison