Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

LocalMind fait tourner un MoE de 37 Go dans un onglet, sur un Mac de 24 Go

LocalMind, page web statique sans serveur ni installation, exécute des modèles via WebGPU. Deux moteurs streamant les poids d'experts depuis le disque permettent à un onglet de dépasser la RAM : un Gemma 4 26B-A4B et un Qwen3.6 MoE de 37 Go tournent sur un MacBook M4 Pro de 24 Go, avec une sortie identique à llama.cpp. Poids denses, routeurs et KV cache vont au GPU, les experts routés restent sur disque.

open-sourcedevmatériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 6 oct. 2026 · 06:59 — voir la méthode.