Sortie de llama.cpp v0.6.0 avec le décodage spéculatif MTP pour Qwen4Exp
llama.cpp passe en version 0.6.0. L'annonce parue sur r/LocalLLaMA indique l'ajout du décodage spéculatif MTP pour Qwen4Exp, en plus d'autres changements évoqués sans être détaillés. Le décodage spéculatif est une technique qui vise à accélérer la génération de tokens en faisant proposer des tokens en amont du modèle principal.
open-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 5 oct. 2026 · 20:02 — voir la méthode.