Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Qwen3.8-Flash-Next 177B tourne à 11-15 tok/s sur une RTX 5070 12 Go

Un utilisateur de r/LocalLLaMA fait tourner Qwen3.8-Flash-Next 177B en quantification UD-IQ3_XXS avec llama.cpp sur Windows, via un système de streaming d'experts. Sur une RTX 5070 12 Go, 32 Go de DDR4-2400 et un Ryzen 5 5600GT en PCIe Gen3, le benchmark atteint 11,5 tok/s, contre environ 7 tok/s sur la configuration héritée, et 14 à 15 tok/s en conversation courante. Un long prompt de code a généré 4 892 tokens à 10,15 tok/s, produisant un jeu Snake fonctionnel en un seul fichier.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 3 oct. 2026 · 07:15 — voir la méthode.