Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Deux CMP 170HX de 64 Go font tourner GLM-5.3-Flash en 384K de contexte

Un utilisateur de r/LocalLLaMA fait tourner GLM-5.3-Flash sur deux cartes CMP 170HX de 64 Go : 384K de contexte et environ 90 tok/s, avec une approche « HBM-first ». Il compare ce montage à son setup Qwen3.8-Flash-Next sur vLLM (AWQ INT4 + FP8 PLE), via des mesures PP/TG et les mêmes tâches de code et d'agent sur DSH. Il reconnaît que la comparaison n'est pas équitable : moteurs et décodage spéculatif diffèrent.

matérielopen-sourcerecherche

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 7 oct. 2026 · 23:54 — voir la méthode.