Kolibri-1 joue à Breakout sans fine-tuning, à 25 ms par décision
Le modèle Kolibri-1 a appris à jouer seul à Breakout, sans fine-tuning, dans le cadre de l'expérience « Less Talk. More Breakout ». L'inférence a été optimisée pour produire des probabilités d'action : environ 25 ms par décision, sans texte généré, sur quatre coups possibles. Les poids sont ouverts et la partie est consultable en ligne.
open-sourcerechercheagents
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 5 oct. 2026 · 23:51 — voir la méthode.