Apex-2 : un MoE de 3,87B entraîné de zéro sur 86,5 milliards de tokens
Un développeur publie Apex-2, un MoE de 3,87 milliards de paramètres (1,45 milliard actif par token) entraîné de zéro, sans poids externes. Toutes les couches sont MoE (16 experts, routage top-4) et le pré-entraînement a consommé 86,5 milliards de tokens sur un GH200, puis deux via DiLoCo. Le DPO a été abandonné faute de gains : HumanEval plafonne à 43,9 et MMLU à 28,6.
open-sourcerecherchedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 4 oct. 2026 · 15:53 — voir la méthode.