Un Qwen3.8-27B Coder quantifié tient dans une carte 24 Go avec 262k de contexte
Un utilisateur a publié sur Hugging Face une version quantifiée, abliterated et ajustée de Qwen3.8-27B Coder, en IQ4_XS avec imatrix pour 18,35 Go, pensée pour remplir une seule carte de 24 Go à environ 240k tokens de contexte. La tête MTP est conservée en Q8_0, ce qui permet d'utiliser --spec-type draft-mtp sans modèle draft séparé. Sur une RX 7900 XTX, il décode à 36–41 tokens/s avec 110k à 170k tokens déjà en contexte, d'après 98 requêtes d'une session de codage agentique.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 2 oct. 2026 · 13:55 — voir la méthode.