Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Un fork de NInfer atteint 400 tok/s sur Qwen 3.8 Flash Next avec une RTX6000

Un développeur partage sur r/LocalLLaMA son fork de NInfer, un moteur d'inférence d'abord pensé pour les RTX 5090 de 32 Go. Sa version ajoute le support de Qwen 3.8 Flash Next et des cartes RTX6000 de 96 Go, avec un débit annoncé de 400 tokens par seconde en conditions idéales. Le passage du 16 bits au 8 bits apporte jusqu'à +39 % en décodage, mais coûte jusqu'à -12 % en prefill sur les courtes invites.

matérieldevopen-source

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 6 oct. 2026 · 11:22 — voir la méthode.