T1 : agent MoE 122 B décroche 64 % sur Terminal-Bench 2.1 grâce au RL long-horizon
Résumé
Une équipe menée par Junyao Yang publie T1, un Mixture-of-Experts de 122 B paramètres entraîné par renforcement pour piloter des agents terminaux sur plus de 300 interactions tool-use par tâche. Sur Terminal-Bench 2.1, T1 atteint 64,0 %, contre 43,8 % pour le modèle de base, et 27,9 % sur Long-Horizon Terminal Bench, dépassant GPT-5.4 et GLM-5.1. Les auteurs mettent en avant leur warm-start actor-critic avec récompenses de processus denses et le rollout routing replay pour stabiliser le training MoE.
Article original publié par huggingface.co
Lire l'article original →Titre original : T1 : agent MoE 122 B décroche 64 % sur Terminal-Bench 2.1 grâce au RL long-horizon