ik_llama.cpp : un fork ajoute la résidence d'experts MoE et le support Q2_0
Un développeur publie un fork d'ik_llama.cpp dédié aux modèles MoE : exécution CPU/GPU adaptée à la bande passante, cache borné et idées de résidence d'experts issues d'un papier arXiv, intégrées à son profileur. Le fork ajoute le support Q2_0, notamment pour faire tourner des modèles comme Qwen3.8-Flash-Next-GSQ-RCO-Coder. Un plafond VRAM de résidence d'experts est configurable via --moe-resident-mib.
open-sourcedevrecherche
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 01:29 — voir la méthode.