GLM 5.3 Flash tourne à 68,8 tok/s sur M5 Ultra 256 via oMLX 0.7.0
Un utilisateur de r/LocalLLaMA rapporte avoir fait tourner GLM 5.3 Flash à 68,8 tok/s sur une machine M5 Ultra 256, en quantification oQ4e avec MTP, via oMLX 0.7.0. Le prefill est mesuré à 1 878 tokens. Il indique partager ces chiffres parce que d'autres benchmarks qu'il a vus lui semblaient en dessous de ses attentes, et qu'il reste selon lui de la marge d'optimisation.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 5 oct. 2026 · 14:08 — voir la méthode.