Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Slipstream : 41–52 tok/s pour un Qwen de 95,5 GiB sur un Mac 64 Go

Un développeur publie Slipstream, un moteur d'inférence C++ Metal compilé pour Apple Silicon, avec streaming d'experts depuis le SSD et drafting spéculatif. Ce checkpoint Qwen3.8-Flash-Next de 95,5 GiB, déjà téléchargé plus de 34 000 fois, tourne 1,76x plus vite que sur son fork llama.cpp : 41–52 tok/s contre 23,1 tok/s sur le même Mac 64 Go. Sur 3 086 requêtes de codage, la vitesse reste à 33–44 tok/s jusqu'à 130 000 tokens de contexte.

matérielopen-sourcedev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 1 oct. 2026 · 23:23 — voir la méthode.