Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

llama.cpp : +5 % sur le traitement de prompt avec Qwen 3.x

Une pull request de SongXiaoXi (#30087) modifie ggml-cuda pour attribuer quatre colonnes d'état GDN par warp dans llama.cpp. Le gain mesuré porte surtout sur le traitement de prompt de Qwen 3.x : pp512 passe de 3075,24 à 3243,60 tokens/s (+5,5 %) et pp4096 de 3059,87 à 3221,08 (+5,3 %). La génération reste quasi inchangée, tg128 à 47,67 tokens/s contre 47,62 (+0,1 %).

open-sourcedevmatériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 8 oct. 2026 · 10:06 — voir la méthode.