Qwen 3.8 27b : des benchmarks brillants, un usage réel en retrait
Un développeur partage son expérience de Qwen 3.8 27b sur 32 Go de VRAM, avec la version Q6 d'Unsloth et OpenCode. Sur de petites tâches, le modèle tient la route, à 30-40 tokens/s en décodage. Mais dès qu'une requête demande de la nuance, il s'enferme dans des boucles de réflexion et peut consommer tout son contexte de 95k sans rien produire. L'écart entre le discours public et l'efficacité réelle interroge.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 02:27 — voir la méthode.