Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Qwen3.6-35B-A3B en Q6 : 3095 tok/s en prefill sur Strix Halo

Un membre du subreddit r/LocalLLaMA partage les performances d'une variante quantifiée en Q6 d'un modèle Qwen3.6-35B-A3B, diffusée sous le nom gufo-Qwen3.6-35B-A3B-Q6dense. Les chiffres annoncés sont de 3095 tokens par seconde en prefill et 190 tokens par seconde en décodage, mesurés sur une configuration Strix Halo. Ce genre de relevé intéresse directement ceux qui font tourner des modèles localement.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 3 oct. 2026 · 06:47 — voir la méthode.