Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

ik_llama.cpp : un fork ajoute la résidence d'experts MoE et le support Q2_0

Un développeur publie un fork d'ik_llama.cpp dédié aux modèles MoE : exécution CPU/GPU adaptée à la bande passante, cache borné et idées de résidence d'experts issues d'un papier arXiv, intégrées à son profileur. Le fork ajoute le support Q2_0, notamment pour faire tourner des modèles comme Qwen3.8-Flash-Next-GSQ-RCO-Coder. Un plafond VRAM de résidence d'experts est configurable via --moe-resident-mib.

open-sourcedevrecherche

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 6 oct. 2026 · 01:29 — voir la méthode.