Qwen3.8-Flash-Next (125B) tourne sur un mini PC Strix Halo : 44-59 tok/s
Après plusieurs semaines de travail, Qwen3.8-Flash-Next — un MoE de 125B (6B actifs) — tourne sur un seul mini PC AMD Strix Halo (Ryzen AI Max+ 395, 128 Go de RAM). L'équipe publie les poids EXL3 de 95 Go et une nouvelle version de Kyojin, son moteur d'inférence ouvert bâti sur ExLlamaV3. Décode : 44 à 59 tok/s avec décodage spéculatif selon la tâche, 32,7 tok/s sans ; préfill à 1 412 tok/s en 4K et 1 367 en 128K.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 5 oct. 2026 · 15:46 — voir la méthode.