UniClawBench : un banc d'essai universel pour évaluer les agents IA proactifs sur des tâches du monde réel
Résumé
UniClawBench propose une évaluation unifiée des agents IA proactifs sur des scénarios web, bureautique et système. Le benchmark met l'accent sur la prise d'initiative et la persistance sur des tâches longues, avec des baselines qui exposent les faiblesses des agents actuels sur la planification à horizon étendu.
Article original publié par huggingface.co
Lire l'article original →Titre original : UniClawBench : un banc d'essai universel pour évaluer les agents IA proactifs sur des tâches du monde réel