Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Tensorfold fait tourner Qwen3.8-27B à 40-60 tps sur un Mac mini M5 Pro

Tensorfold, moteur d'inférence open source, atteint 40 à 60 tokens/s avec Qwen3.8-27B sur un Mac mini M5 Pro, via le modèle Vontra/Qwen3.8-27B-MLX-4bit et un modèle de drafting. L'auteur du post assure que c'est la première fois qu'un moteur de l'écosystème Mac dépasse MTPLX, après avoir testé mlx, llama-cpp, lm-studio ou unsloth. Il envisage désormais de remplacer sa RTX 3090 Ti par ce mini comme serveur d'inférence principal.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 30 sept. 2026 · 14:05 — voir la méthode.