MTP dans llama.cpp décode désormais de façon compétitive face à ds4 avec GLM 5.3 Flash
Sur r/LocalLLaMA, un utilisateur constate que MTP dans llama.cpp décode désormais de façon compétitive face à ds4 avec GLM 5.3 Flash. Le prompt processing reste plus lent, mais c'est la première fois qu'il voit un modèle surpasser ds4 — avec le tuning M3U d'IngeniousIdiocy — alors que MTP n'apportait jusqu'ici aucun avantage sur Apple Silicon. Qwen38FN sera le vrai test : ds4 vanilla sort 65 t/s, 75 en concurrence.
devopen-sourcematériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 8 oct. 2026 · 17:45 — voir la méthode.