Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Un quant low-bit de Qwen 3.8 Flash pour tourner sur un seul Spark

Un membre de r/LocalLLaMA publie un quant low-bit du modèle base Qwen 3.8 Flash, pensé pour tourner sur un seul Spark. Selon l'auteur, ce quant conserve 95 % de la précision b16 et ne subit pas de dégradation sur les contextes longs. Il laisse aussi la marge nécessaire pour faire tourner du 256k de contexte et du RoPE, avec un débit d'environ 40 tok/s. Les poids sont déposés sur Hugging Face.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 2 oct. 2026 · 11:31 — voir la méthode.