Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Tested in Coding : un retour d'essai sur Strata sous llama.cpp

Sur r/LocalLLaMA, l'auteur de la série « Tested in Coding » consacre un nouveau retour à Strata. Il détaille sa configuration : Qwen3.8-Flash-Next-UD-IQ3_XXS, KV-cache Q8_0 sous llama.cpp, 30 à 40 tokens/s en génération, 530 tokens/s en prefill et 220 000 tokens de contexte, une limite liée à la VRAM. Il dit avoir étudié en amont le réglage des paramètres d'échantillonnage propres à Strata.

open-sourcedevmatériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 7 oct. 2026 · 23:54 — voir la méthode.