Gufo : 70 tok/s sur Qwen3.8 27B, mais le chiffre repose sur du speculative decoding
Un utilisateur de r/LocalLLaMA a testé Gufo 0.4.0 via son image podman, sur Qwen3.8 27B en Q4, avec le modèle de draft DFlash2 et le script de benchmark fourni par le projet. Il a bien mesuré 70,22 tok/s, conformément au chiffre affiché sur le GitHub de Gufo. Mais le prompt utilisé est « écrire le mot red exactement 1000 fois », et toute la vitesse vient du speculative decoding : le draft devine environ 7 tokens d'avance.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 1 oct. 2026 · 23:23 — voir la méthode.