Qwen3.8-Flash-Next sur une seule R9700 : 863 t/s en prefill, 34,7 t/s en décodage
Sur r/LocalLLaMA, un utilisateur fait tourner Qwen3.8-Flash-Next sur une seule carte R9700, en exl3 5.05 bpw et avec le fork ROCm d'exllamav3. Il place 112 des 512 experts de chaque couche sur le GPU, les 400 autres sur le CPU via 16 threads, et lit en flux une table ngram de 102 Go depuis le NVMe. À 230k de contexte : 863 t/s en prefill sur les 101 000 nouveaux tokens, 34,7 t/s en décodage, acceptation MTP de 53-54 %.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 2 oct. 2026 · 11:31 — voir la méthode.