Slipstream : 41–52 tok/s pour un Qwen de 95,5 GiB sur un Mac 64 Go
Un développeur publie Slipstream, un moteur d'inférence C++ Metal compilé pour Apple Silicon, avec streaming d'experts depuis le SSD et drafting spéculatif. Ce checkpoint Qwen3.8-Flash-Next de 95,5 GiB, déjà téléchargé plus de 34 000 fois, tourne 1,76x plus vite que sur son fork llama.cpp : 41–52 tok/s contre 23,1 tok/s sur le même Mac 64 Go. Sur 3 086 requêtes de codage, la vitesse reste à 33–44 tok/s jusqu'à 130 000 tokens de contexte.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 1 oct. 2026 · 23:23 — voir la méthode.