Qwen 3.8 Flash Next en Q4_K_XL : 80 à 110 tok/s sur deux RTX 3090
Un utilisateur de r/LocalLLaMA fait tourner Qwen 3.8 Flash Next en quantification Q4_K_XL avec Strata, sur deux RTX 3090 et 96 Go de DDR5. Il annonce 80 à 110 tokens par seconde pour un prompt de 2500 tokens, avec une intelligence supérieure au Qwen 3.8 27b selon lui. Le modèle reste accessible aux configurations à faible VRAM, ce qui pourrait permettre de remplacer le 27b comme modèle principal.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 4 oct. 2026 · 00:10 — voir la méthode.