huggingface.co détecté sur le web

T1 : agent MoE 122B décroche 64 % sur Terminal-Bench 2.1

TL;DR

  • T1, un Mixture-of-Experts de 122 milliards de paramètres, résout 64,0 % de Terminal-Bench 2.1 contre 43,8 % pour son modèle de base.
  • Sur Long-Horizon Terminal Bench, T1 atteint 27,9 % et dépasse GPT-5.4 et GLM-5.1 selon la table de résultats des auteurs.
  • La recette combine warm-start actor-critic, récompenses de processus denses, et deux techniques nommées TITO construction et rollout routing replay.

Sur Terminal-Bench 2.1, T1 fait passer un modèle de base de 43,8 % à 64,0 % de tâches résolues, en tenant jusqu'à plus de 300 tours d'outils dans un vrai shell sandboxé. Le preprint arXiv signé Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang et coauteurs décrit T1 comme un « Mixture-of-Experts model of 122B total trained with reinforcement learning, operating a real shell in a cloud sandbox for up to 300+ tool-call turns per task », couvrant code et tâches scientifiques.

La méthode revendiquée tient dans un warm-start actor-critic agressif, des récompenses de processus adossées à des vérificateurs de passage, plus deux techniques d'optimisation nommées TITO construction et rollout routing replay. Le corpus d'entraînement est décrit comme « Fully out-of-distribution training corpus: isolated seeds and synthesized tasks disjoint from Terminal-Bench 2.1 ». Sur le banc plus exigeant Long-Horizon Terminal Bench, T1 « 27.9% and surpasses GPT-5.4 and GLM-5.1 » selon la table de résultats.

Comme indicateur de stabilité MoE, les auteurs mettent en avant la chute de l'écart entre log-probabilités d'entraînement et d'inférence, de 0,021 à 0,013. L'abstract ne précise ni les affiliations ni les snapshots exacts des modèles concurrents. C'est un nouveau signal, dans la foulée de l'ouverture publique de l'Agents API d'OpenAI, que les recettes pour agents de code à horizon long remontent au premier plan.