Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

LoRA sur GGUF : entraîner Qwen3.8-Flash-Next dans 40 Gio de VRAM

Une nouvelle étape de la série « LoRA over GGUF » permet d'entraîner Qwen3.8-Flash-Next (125B-A6B + 51B d'engram) dans 40 Gio de VRAM, sans déchargement CPU, avec l'engram sur disque sans perte de vitesse. Sur Strix Halo, l'entraînement tourne à 9,5 s/it sur des chunks de contexte de 2048, soit 200 tokens/s, loin des plus de 1600 tokens/s atteints en prefill. Depuis transformers 5.18, le support initial des GGUF modernes est fusionné, et le dépôt torch-ggml-ops contient GGTensile, une optimisation assembleur des kernels MMQ déjà plus rapide que HIP dans de nombreux cas.

open-sourcedevmatériel

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 9 oct. 2026 · 04:51 — voir la méthode.