llama.cpp : +5 % sur le traitement de prompt avec Qwen 3.x
Une pull request de SongXiaoXi (#30087) modifie ggml-cuda pour attribuer quatre colonnes d'état GDN par warp dans llama.cpp. Le gain mesuré porte surtout sur le traitement de prompt de Qwen 3.x : pp512 passe de 3075,24 à 3243,60 tokens/s (+5,5 %) et pp4096 de 3059,87 à 3221,08 (+5,3 %). La génération reste quasi inchangée, tg128 à 47,67 tokens/s contre 47,62 (+0,1 %).
open-sourcedevmatériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 8 oct. 2026 · 10:06 — voir la méthode.