CivBench : un benchmark contrôlé où les LLM jouent à Civilization V
Une version contrôlée de CivBench évalue des modèles sur des parties complètes de Civilization V. Ce jeu de stratégie au tour par tour sert à tester des décisions dont les conséquences n'apparaissent qu'après 50 ou 100 tours. GLM-5.3 devance Opus-5.5, et Qwen-3.8-27B résiste étonnamment bien. Les auteurs testent aussi GPT-6.1-Sol et GPT-6-Astra, et invitent à suggérer d'autres modèles, notamment ouverts.
rechercheopen-sourceclaude
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 01:29 — voir la méthode.