8 Radeon Pro V620, 256 Go de VRAM et un fork vLLM pour faire tourner Qwen en local
Un utilisateur de r/LocalLLaMA détaille une machine à 2 800 dollars bâtie sur huit Radeon Pro V620, des cartes RDNA2 d'entreprise de 32 Go de VRAM, soit 256 Go au total. Avec llama.cpp, le prefill plafonnait à 350-450 t/s et la concurrence était mal gérée ; vLLM ne fonctionnait pas sur ces cartes. Il a fini par écrire avec Claude un fork compatible, bien plus rapide.
matérielopen-sourcedevclaude
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 8 oct. 2026 · 17:45 — voir la méthode.