Un quant low-bit de Qwen 3.8 Flash pour tourner sur un seul Spark
Un membre de r/LocalLLaMA publie un quant low-bit du modèle base Qwen 3.8 Flash, pensé pour tourner sur un seul Spark. Selon l'auteur, ce quant conserve 95 % de la précision b16 et ne subit pas de dégradation sur les contextes longs. Il laisse aussi la marge nécessaire pour faire tourner du 256k de contexte et du RoPE, avec un débit d'environ 40 tok/s. Les poids sont déposés sur Hugging Face.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 2 oct. 2026 · 11:31 — voir la méthode.