Quantization

Compresser un modèle en réduisant la précision de ses chiffres internes (de 16 bits à 8, 4, voire moins) pour qu'il tienne dans une machine plus modeste et tourne plus vite. C'est la raison pour laquelle tu peux faire tourner un modèle open-weight sur ton laptop au lieu d'un serveur à plusieurs GPU. Le compromis : à compression égale, le modèle reste très bon sur les tâches courantes, mais perd un peu de finesse sur le raisonnement difficile et les détails précis.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar