Deux CMP 170HX de 64 Go font tourner GLM-5.3-Flash en 384K de contexte
Un utilisateur de r/LocalLLaMA fait tourner GLM-5.3-Flash sur deux cartes CMP 170HX de 64 Go : 384K de contexte et environ 90 tok/s, avec une approche « HBM-first ». Il compare ce montage à son setup Qwen3.8-Flash-Next sur vLLM (AWQ INT4 + FP8 PLE), via des mesures PP/TG et les mêmes tâches de code et d'agent sur DSH. Il reconnaît que la comparaison n'est pas équitable : moteurs et décodage spéculatif diffèrent.
matérielopen-sourcerecherche
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 7 oct. 2026 · 23:54 — voir la méthode.