Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

MoE en faible VRAM : des débits mitigés avec le cache GPU d'experts de llama.cpp

Un utilisateur de r/LocalLLaMA teste la PR #29887, qui ajoute un cache GPU pour les experts MoE conservés en mémoire hôte. Sur une RTX 4060 (8 Go de VRAM) et 32 Go de RAM DDR5, avec Qwen3.6-35B-A3B en IQ4_XS, il n'obtient pas les débits espérés : 45 t/s en évaluation de prompt et 23 t/s en génération. Il demande de l'aide et invite les autres à partager leurs mesures.

matérielopen-sourcedev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 8 oct. 2026 · 17:45 — voir la méthode.