Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

MLX : stager les poids quantifiés en FP8 dope le prefill de 40 %

Sur MLX, la multiplication de matrices quantifiées restage les opérandes en FP16. En les stagant en FP8, on accède au chemin matriciel FP8 deux fois plus rapide du matériel Apple Silicon M6. La même idée en int8 sur M5 donne un gain comparable de prefill : +40 % sur Qwen3-8B, jusqu'à +50 % sur un modèle 27B. Ce fork, non upstream (mlx#4627), augmente la perplexité de moins de 1 %.

matérieldevopen-sourcerecherche

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 8 oct. 2026 · 22:50 — voir la méthode.