Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

llama.cpp : une PR divise par deux la mémoire des scores d'indexation de Qwen

Une pull request ouverte sur le dépôt ggml-org/llama.cpp propose de réduire de moitié la mémoire occupée par les scores de l'indexeur. Elle porte le numéro 29825 et est signée ServeurpersoCom. Le résultat annoncé : Qwen Flash Next consomme désormais moins de VRAM. Pour les utilisateurs de llama.cpp, cela laisse de la marge sur des machines dont la mémoire vidéo est limitée.

open-sourcedevmatériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 3 oct. 2026 · 07:15 — voir la méthode.