Compresser et fine-tuner un modèle

La famille de techniques qui sert soit à rétrécir un modèle, soit à l'adapter à ton besoin. Quantification : on stocke les poids en précision plus basse (de 16 bits à 4 bits), même modèle, juste plus petit et plus rapide. Distillation : un petit modèle élève apprend à imiter un gros modèle professeur, tu obtiens un modèle différent et plus léger. LoRA : on fine-tune en n'entraînant qu'un petit jeu de poids ajoutés, pas tous, donc adapter un énorme modèle devient bon marché ; QLoRA fait pareil après avoir quantifié la base en 4 bits, pour tenir sur un seul GPU grand public. SFT contre RLHF : entraîner sur des exemples à copier (imitation) contre entraîner sur ce que les humains ont préféré (optimisation des préférences). Prefill contre decode : lire tout le prompt en une passe parallèle contre générer la réponse token par token.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar