Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

AgrillaMoE : Qwen3.6-35B sur un GPU de 16 Go

Un fork de llama.cpp, AgrillaMoE, fait tourner Qwen3.6-35B-A3B avec les quants Unsloth sur un V100 16 Go, à 57-60 tok/s, en exposant les API OpenAI et Anthropic : Claude Code s'y connecte directement. Son patch d'expansion MoE relève à l'exécution le nombre d'experts activés (--moe-experts 20, seuil adaptatif, couches 25-39), sans réentraînement. Sur GPQA-Diamond en Q8_0, il passe de 81,82 % à 84,34 %.

open-sourcedevclaudematériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 4 oct. 2026 · 18:18 — voir la méthode.