Speculative decoding

Un modèle écrit un mot à la fois, et chaque mot demande de relire tout ce qui précède : c'est lent par construction. Le speculative decoding inverse la charge. Un petit modèle rapide rédige plusieurs mots d'avance, puis le gros modèle les relit tous en une seule passe et garde le plus long début qu'il aurait écrit lui-même. Le reste est jeté. Tu obtiens exactement le texte que le gros modèle aurait produit seul, en deux à trois fois moins d'allers-retours.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar