Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

CivBench : un benchmark contrôlé où les LLM jouent à Civilization V

Une version contrôlée de CivBench évalue des modèles sur des parties complètes de Civilization V. Ce jeu de stratégie au tour par tour sert à tester des décisions dont les conséquences n'apparaissent qu'après 50 ou 100 tours. GLM-5.3 devance Opus-5.5, et Qwen-3.8-27B résiste étonnamment bien. Les auteurs testent aussi GPT-6.1-Sol et GPT-6-Astra, et invitent à suggérer d'autres modèles, notamment ouverts.

rechercheopen-sourceclaude

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 6 oct. 2026 · 01:29 — voir la méthode.