Un moteur d'inférence de 5 Ko en assembleur x86-64 pour Gemma-2B
Un développeur publie un moteur d'inférence pour Gemma-2B écrit entièrement en assembleur x86-64 à plat (FASM). Le binaire pèse 5,2 Ko, sans runtime C/C++ ni PyTorch, et s'exécute en AVX2 + F16C avec un GEMM 4 threads pour le prefill. Il tient 4,5 à 4,7 tokens/s en FP16 sur un i5 quad-core ancien. L'auteur y voit une exploration par les premiers principes, pas un concurrent de llama.cpp.
devmatérielopen-sourcerecherche
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 4 oct. 2026 · 04:49 — voir la méthode.