llama.cpp : régler un modèle quantifié IQ1 sur deux RTX 5060 Ti
Un utilisateur de r/LocalLLaMA fait tourner un modèle Qwen 3.8 Flash Next GSQ RCO IQ1_M de 27,58 Go sur deux RTX 5060 Ti 16 Go et 32 Go de DDR4. Il détaille ses paramètres llama.cpp : contexte de 98 304 tokens, cache K et V en q8_0, 999 couches sur GPU, embeddings sur CPU. Il demande si sa configuration est correcte, faute de retours cohérents sur ce modèle avec ce matériel.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 4 oct. 2026 · 23:14 — voir la méthode.