SWE-Bench ProMax : 170 tâches de refactoring multilingue, meilleur modèle bloqué à 41,2 %
Résumé
SWE-Bench ProMax rassemble 170 tâches de refactoring extraites de commits réels dans sept langages (Python, Java, TypeScript, Go, C, C++, Rust), avec en moyenne 11,4 fichiers modifiés et 261,6 lignes changées par instance. Les issues sont réécrites et les suites de tests manuellement filtrées pour supprimer les tests trop étroits ou trop larges qui gangrenaient SWE-Bench Verified. Sous deux scaffolds, le meilleur modèle frontière plafonne à 41,2 % de résolution, ce qui recale nettement le baromètre agentique.
Shared on Bluesky by 1 AI expert
Article original publié par huggingface.co
Lire l'article original →Titre original : SWE-Bench ProMax : 170 tâches de refactoring multilingue, meilleur modèle bloqué à 41,2 %