GLM-4.7 : trois quantifications comparées sur un iGPU Radeon 680M
Un utilisateur de r/LocalLLaMA a comparé trois quantifications de GLM-4.7 sur un mini-PC Acemagic S3A (Ryzen 7 6800H, 64 Go de DDR5), via le binaire Vulkan de llama.cpp sous Ubuntu. Les fichiers MXFP4, UD-Q4_K_XL et Q4_K_M pèsent de 15,79 à 17,05 GiB. Détail notable : llama-bench lit l'en-tête interne des GGUF et annonce deepseek2 30B.A3B, une architecture MoE d'environ 30 milliards de paramètres.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 5 oct. 2026 · 00:37 — voir la méthode.