Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

InferBench : les LLM peinent à déduire les priorités d'un utilisateur

Un nouveau benchmark, InferBench, évalue la capacité des LLM à inférer les priorités d'un utilisateur à partir de ses instructions. Sur 12 modèles, 20 scénarios et 2 800 conversations, la précision atteint 89 % quand les priorités sont énoncées d'emblée, mais chute à 60 % quand certaines restent implicites. GPT-6 Astra (76 %), MiMo V2.6 Pro (75 %) et Gemini 3.1 Pro (69 %) arrivent en tête.

rechercheopen-sourcegemini

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 7 oct. 2026 · 00:25 — voir la méthode.