Tensorfold fait tourner Qwen3.8-27B à 40-60 tps sur un Mac mini M5 Pro
Tensorfold, moteur d'inférence open source, atteint 40 à 60 tokens/s avec Qwen3.8-27B sur un Mac mini M5 Pro, via le modèle Vontra/Qwen3.8-27B-MLX-4bit et un modèle de drafting. L'auteur du post assure que c'est la première fois qu'un moteur de l'écosystème Mac dépasse MTPLX, après avoir testé mlx, llama-cpp, lm-studio ou unsloth. Il envisage désormais de remplacer sa RTX 3090 Ti par ce mini comme serveur d'inférence principal.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 30 sept. 2026 · 14:05 — voir la méthode.