Un 3090 et 32 Go de RAM : peut-on faire tourner Qwen3.6-35B-A3B en Q8 ?
Sur r/LocalLLaMA, un utilisateur disposant d'un seul RTX 3090 et de 32 Go de RAM cherche un moteur d'inférence capable de faire tourner Qwen/Qwen3.6-35B-A3B en Q8 rapidement. Il évoque strata et ninfer, mais juge insuffisants les résultats obtenus avec Qwen Flash en Q2 comme ceux d'un modèle 27B en Q4. Il demande donc si un moteur permet d'y parvenir sur sa configuration.
matérielopen-sourcedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 7 oct. 2026 · 22:18 — voir la méthode.