Sur Mac Studio M5 Ultra, Qwen3.8 Flash Next domine Laguna S 2.1 en prefill
Test sur Mac Studio M5 Ultra 256 Go : Qwen3.8-Flash-Next (oMLX) face à Laguna-S-2.1 GGUF (LM Studio), contexte plafonné à 262K et aucun token en cache. Qwen tient environ 4 200 tok/s en prefill linéaire (47 s à 200K) là où Laguna monte à 455 s. Le prefill pèse 94 % du temps total à 200K, et le décodage Laguna tombe de 68 à 34 tok/s quand le contexte grandit. Le testeur signale qu'un premier essai était faussé par des préfixes partagés laissant le KV cache se propager.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 30 sept. 2026 · 22:58 — voir la méthode.