huggingface.co détecté sur le web

EarlyEval prédit l'issue d'un run d'agent en cours et coupe 26 % des étapes, -44 % de tokens

Agents Coding Tools ai-business

Résumé

Une équipe de Shanghai Jiao Tong, SMU et ECNU présente EarlyEval, un framework qui entraîne des classifieurs LightGBM à prédire la réussite ou l'échec d'un agent LLM avant la fin d'un run. Sur SWE-bench Verified, TerminalBench et Toolathlon, EarlyEval élimine 13–26 % des étapes et jusqu'à 44,1 % des tokens en entrée, tout en préservant le taux de résolution à 1–2 points près.