EarlyEval prédit l'issue d'un run d'agent en cours et coupe 26 % des étapes, -44 % de tokens
Résumé
Une équipe de Shanghai Jiao Tong, SMU et ECNU présente EarlyEval, un framework qui entraîne des classifieurs LightGBM à prédire la réussite ou l'échec d'un agent LLM avant la fin d'un run. Sur SWE-bench Verified, TerminalBench et Toolathlon, EarlyEval élimine 13–26 % des étapes et jusqu'à 44,1 % des tokens en entrée, tout en préservant le taux de résolution à 1–2 points près.
Article original publié par huggingface.co
Lire l'article original →Titre original : EarlyEval prédit l'issue d'un run d'agent en cours et coupe 26 % des étapes, -44 % de tokens