llama.cpp : le support MTP arrive pour Qwen Flash Next
Une pull request ajoutant le support de MTP (Multi-Token Prediction) à Qwen Flash Next a été fusionnée dans llama.cpp, après 17 heures de développement. Les quantifications du modèle sont désormais publiées sur le dépôt ggml-org/Qwen3.8-Flash-Next-GGUF. De quoi, selon l'auteur du message, envisager de passer de Qwen 3.8 27B à ce modèle.
open-sourcedevrecherche
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 1 oct. 2026 · 13:47 — voir la méthode.