AgrillaMoE : Qwen3.6-35B sur un GPU de 16 Go
Un fork de llama.cpp, AgrillaMoE, fait tourner Qwen3.6-35B-A3B avec les quants Unsloth sur un V100 16 Go, à 57-60 tok/s, en exposant les API OpenAI et Anthropic : Claude Code s'y connecte directement. Son patch d'expansion MoE relève à l'exécution le nombre d'experts activés (--moe-experts 20, seuil adaptatif, couches 25-39), sans réentraînement. Sur GPQA-Diamond en Q8_0, il passe de 81,82 % à 84,34 %.
open-sourcedevclaudematériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 4 oct. 2026 · 18:18 — voir la méthode.