Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Un Qwen3.8-27B Coder quantifié tient dans une carte 24 Go avec 262k de contexte

Un utilisateur a publié sur Hugging Face une version quantifiée, abliterated et ajustée de Qwen3.8-27B Coder, en IQ4_XS avec imatrix pour 18,35 Go, pensée pour remplir une seule carte de 24 Go à environ 240k tokens de contexte. La tête MTP est conservée en Q8_0, ce qui permet d'utiliser --spec-type draft-mtp sans modèle draft séparé. Sur une RX 7900 XTX, il décode à 36–41 tokens/s avec 110k à 170k tokens déjà en contexte, d'après 98 requêtes d'une session de codage agentique.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 2 oct. 2026 · 13:55 — voir la méthode.