llama.cpp : une PR divise par deux la mémoire des scores d'indexation de Qwen
Une pull request ouverte sur le dépôt ggml-org/llama.cpp propose de réduire de moitié la mémoire occupée par les scores de l'indexeur. Elle porte le numéro 29825 et est signée ServeurpersoCom. Le résultat annoncé : Qwen Flash Next consomme désormais moins de VRAM. Pour les utilisateurs de llama.cpp, cela laisse de la marge sur des machines dont la mémoire vidéo est limitée.
open-sourcedevmatériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 3 oct. 2026 · 07:15 — voir la méthode.