Quatre modèles de décision open source comparés mot à mot sur une RTX 4090
Un utilisateur de r/LocalLLaMA a testé sur une même RTX 4090 quatre modèles de décision sortis récemment : laya, d1 de Liquid, clef-flash de Cloudflare et lev d'Interfaze. La tâche : lire mot à mot neuf articles Wikipédia sur les centipèdes (9 534 mots) et signaler chaque mot qui en nomme un, avec un appel par mot. Laya affiche 3,9 ms par mot en p50 contre 6,0 ms pour d1 3B, tous deux sous llama.cpp b11495.
open-sourcematérielrecherchedev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 8 oct. 2026 · 17:45 — voir la méthode.