Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

SWE-sweep, un benchmark où l'agent chasse les bugs avant les utilisateurs

Un nouveau benchmark, SWE-sweep, propose de confier à un agent un large dépôt de code pour qu'il trouve et corrige un maximum de bugs par lui-même. Le score repose sur un ensemble caché de bugs réels, filtrés pour être détectables et corrigeables à la seule lecture du dépôt. Il est signé par des chercheurs de Meta, Stanford, Harvard et UW ; le classement s'étend encore à d'autres modèles locaux.

rechercheagentsdevmeta

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 2 oct. 2026 · 16:10 — voir la méthode.