Quantization
Compresser un modèle en réduisant la précision de ses chiffres internes (de 16 bits à 8, 4, voire moins) pour qu'il tienne dans une machine plus modeste et tourne plus vite. C'est la raison pour laquelle tu peux faire tourner un modèle open-weight sur ton laptop au lieu d'un serveur à plusieurs GPU. Le compromis : à compression égale, le modèle reste très bon sur les tâches courantes, mais perd un peu de finesse sur le raisonnement difficile et les détails précis.
Forces
- Rend possible le modèle local sur un laptop : confidentialité totale, coût API nul
- Q4 divise la taille par ~4 en gardant la qualité utilisable au quotidien
Limites
- Trop compresser dégrade le raisonnement difficile et les détails précis (chiffres, code)
Pour qui
- Choisir la bonne version d'un modèle open-weight à faire tourner en local