Qwen3.8-Flash-Next 177B tourne à 11-15 tok/s sur une RTX 5070 12 Go
Un utilisateur de r/LocalLLaMA fait tourner Qwen3.8-Flash-Next 177B en quantification UD-IQ3_XXS avec llama.cpp sur Windows, via un système de streaming d'experts. Sur une RTX 5070 12 Go, 32 Go de DDR4-2400 et un Ryzen 5 5600GT en PCIe Gen3, le benchmark atteint 11,5 tok/s, contre environ 7 tok/s sur la configuration héritée, et 14 à 15 tok/s en conversation courante. Un long prompt de code a généré 4 892 tokens à 10,15 tok/s, produisant un jeu Snake fonctionnel en un seul fichier.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 3 oct. 2026 · 07:15 — voir la méthode.