Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Gufo : 70 tok/s sur Qwen3.8 27B, mais le chiffre repose sur du speculative decoding

Un utilisateur de r/LocalLLaMA a testé Gufo 0.4.0 via son image podman, sur Qwen3.8 27B en Q4, avec le modèle de draft DFlash2 et le script de benchmark fourni par le projet. Il a bien mesuré 70,22 tok/s, conformément au chiffre affiché sur le GitHub de Gufo. Mais le prompt utilisé est « écrire le mot red exactement 1000 fois », et toute la vitesse vient du speculative decoding : le draft devine environ 7 tokens d'avance.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 1 oct. 2026 · 23:23 — voir la méthode.