InferBench : les LLM peinent à déduire les priorités d'un utilisateur
Un nouveau benchmark, InferBench, évalue la capacité des LLM à inférer les priorités d'un utilisateur à partir de ses instructions. Sur 12 modèles, 20 scénarios et 2 800 conversations, la précision atteint 89 % quand les priorités sont énoncées d'emblée, mais chute à 60 % quand certaines restent implicites. GPT-6 Astra (76 %), MiMo V2.6 Pro (75 %) et Gemini 3.1 Pro (69 %) arrivent en tête.
rechercheopen-sourcegemini
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 7 oct. 2026 · 00:25 — voir la méthode.