Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Qwen3.8-Flash-Next sur une seule R9700 : 863 t/s en prefill, 34,7 t/s en décodage

Sur r/LocalLLaMA, un utilisateur fait tourner Qwen3.8-Flash-Next sur une seule carte R9700, en exl3 5.05 bpw et avec le fork ROCm d'exllamav3. Il place 112 des 512 experts de chaque couche sur le GPU, les 400 autres sur le CPU via 16 threads, et lit en flux une table ngram de 102 Go depuis le NVMe. À 230k de contexte : 863 t/s en prefill sur les 101 000 nouveaux tokens, 34,7 t/s en décodage, acceptation MTP de 53-54 %.

matérielopen-sourcedev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 2 oct. 2026 · 11:31 — voir la méthode.