Un fork de NInfer atteint 400 tok/s sur Qwen 3.8 Flash Next avec une RTX6000
Un développeur partage sur r/LocalLLaMA son fork de NInfer, un moteur d'inférence d'abord pensé pour les RTX 5090 de 32 Go. Sa version ajoute le support de Qwen 3.8 Flash Next et des cartes RTX6000 de 96 Go, avec un débit annoncé de 400 tokens par seconde en conditions idéales. Le passage du 16 bits au 8 bits apporte jusqu'à +39 % en décodage, mais coûte jusqu'à -12 % en prefill sur les courtes invites.
matérieldevopen-source
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 11:22 — voir la méthode.