Ternary Bonsai 2 27B
Ternary Bonsai 2 27B est une version compressée de Qwen3.8-27B, publiée en septembre 2026 par PrismML sous licence Apache 2.0. Chaque poids est réduit à presque rien (compression dite ternaire), si bien que le modèle de 27 milliards de paramètres tient en 5,95 Go (format PTQ1_0) ou 7,21 Go (PQ2_0), au lieu de 53,8 Go en pleine précision. Il lit 262 000 jetons de contexte. Sur 14 tests en mode réflexion, PrismML annonce une moyenne de 84,78, contre 86,32 pour l'original non compressé, 72,59 pour la compression classique IQ2_XXS (9,4 Go) et 85,18 pour UD-Q4_K_XL (17,6 Go).
Forces
- Un modèle de 27 milliards de paramètres en 5,95 à 7,21 Go, contre 53,8 Go pour la version d'origine
- 84,78 de moyenne sur 14 tests en mode réflexion, contre 72,59 pour la compression classique IQ2_XXS qui pèse pourtant plus lourd (9,4 Go)
- 262 000 jetons de contexte et une licence Apache 2.0 qui autorise l'usage commercial
Limites
- Le llama.cpp standard ne lit pas ces fichiers : il faut compiler le fork de PrismML, et Ollama comme LM Studio restent hors jeu en attendant
- Tous les scores viennent de l'éditeur, aucune mesure indépendante publiée à ce jour
- La commande Ollama affichée sur Hugging Face télécharge la version pleine précision de 53,8 Go, pas la version compressée
Pour qui
- Développeurs avec une carte graphique de 8 Go qui veulent un modèle local plus solide qu'un 7B
- Équipes qui doivent garder leurs données sur leurs machines et acceptent de compiler un outil