LoRA sur GGUF : entraîner Qwen3.8-Flash-Next dans 40 Gio de VRAM
Une nouvelle étape de la série « LoRA over GGUF » permet d'entraîner Qwen3.8-Flash-Next (125B-A6B + 51B d'engram) dans 40 Gio de VRAM, sans déchargement CPU, avec l'engram sur disque sans perte de vitesse. Sur Strix Halo, l'entraînement tourne à 9,5 s/it sur des chunks de contexte de 2048, soit 200 tokens/s, loin des plus de 1600 tokens/s atteints en prefill. Depuis transformers 5.18, le support initial des GGUF modernes est fusionné, et le dépôt torch-ggml-ops contient GGTensile, une optimisation assembleur des kernels MMQ déjà plus rapide que HIP dans de nombreux cas.
open-sourcedevmatériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 9 oct. 2026 · 04:51 — voir la méthode.