Des moteurs d'inférence ultra-spécialisés, taillés pour un seul modèle
Une nouvelle catégorie de moteurs d'inférence très étroits émerge : Strata, ninfer, DwarfStar, Splash, llamAmpere ou gufo. Ils abandonnent volontairement la généralité qui fait la force de llama.cpp et vLLM pour optimiser un petit nombre de modèles, parfois une seule famille de matériel comme Strix Halo. L'auteur y voit un pas de plus vers la démocratisation et la décentralisation de l'intelligence.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 3 oct. 2026 · 18:48 — voir la méthode.