Une quantization MLX de Swift 1.5 calibrée pour le Mac Studio M5 Ultra 96 Go
Un utilisateur de r/LocalLLaMA a publié sur Hugging Face un pack MLX en 4,7 bpw de Swift 1.5 d'UkisAI, calibré pour le Mac Studio 96 Go équipé d'une puce M5 Ultra. Sur sa machine et avec mlx-serve 26.10.1, le préfill atteint 3 191 tok/s sur un prompt de 25k tokens et 2 928 tok/s sur 95k, contre 1 427 et 1 307 tok/s pour le pack llama.cpp IQ3_XXS. En décodage, il mesure 113,7 tok/s après un prompt de 4k et 81,1 tok/s après 95k, contre 62,7 et 44,7 tok/s côté llama.cpp. L'accord top-1 avec Swift BF16 est de 91,0 % pour le pack MLX contre 84,1 %, mesuré sur 680 positions de validation.
open-sourcematérielrecherche
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 02:27 — voir la méthode.