Compresser et fine-tuner un modèle
La famille de techniques qui sert soit à rétrécir un modèle, soit à l'adapter à ton besoin. Quantification : on stocke les poids en précision plus basse (de 16 bits à 4 bits), même modèle, juste plus petit et plus rapide. Distillation : un petit modèle élève apprend à imiter un gros modèle professeur, tu obtiens un modèle différent et plus léger. LoRA : on fine-tune en n'entraînant qu'un petit jeu de poids ajoutés, pas tous, donc adapter un énorme modèle devient bon marché ; QLoRA fait pareil après avoir quantifié la base en 4 bits, pour tenir sur un seul GPU grand public. SFT contre RLHF : entraîner sur des exemples à copier (imitation) contre entraîner sur ce que les humains ont préféré (optimisation des préférences). Prefill contre decode : lire tout le prompt en une passe parallèle contre générer la réponse token par token.
Forces
- Range en une grille les sigles qu'on croise partout (LoRA, QLoRA, SFT, RLHF) sans avoir à entraîner quoi que ce soit
- Donne de quoi challenger une promesse fournisseur « plus rapide et moins cher » sur ce qu'elle coûte vraiment
Limites
- Vocabulaire pointu : utile à lire, mais à appliquer il faut une vraie contrainte d'infra, sinon c'est de la complexité pour rien
Pour qui
- Un tech lead ou un PM technique qui doit arbitrer entre un gros modèle cher et une version compressée moins chère