huggingface.co détecté sur le web

RSIAgent: Kimi-K3 et GLM-5.3 dépassent GPT-6 sans entraînement

TL;DR

  • RSIAgent est un cadre multi-agents « training-free » qui coordonne curriculum, actor et verifier pour bâtir une mémoire réutilisable par exploration autonome.
  • Sur OSWorld-v2, RSIAgent atteint 78.98% de Partial Score contre 72.60% pour GPT-6 Astra, et 84.82% sur Agent's Last Exam contre 82.26%.
  • La mémoire construite est gelée et réutilisable pour des tâches en aval sans mise à jour des paramètres du modèle, selon les auteurs.

Un cadre multi-agents « training-free » permet à des modèles ouverts de dépasser GPT-6 sur deux benchmarks d'agents desktop, selon une prépublication signée Sibo Zhu et cinq co-auteurs. Sur arXiv, le système RSIAgent fait grimper le tandem Kimi-K3 / GLM-5.3 à 78.98% de Partial Score sur OSWorld-v2 contre 72.60% pour GPT-6 Astra, et à 84.82% sur Agent's Last Exam contre 82.26%.

Les auteurs présentent RSIAgent comme « a training-free multi-agent framework for recursive self-improvement through autonomous memory construction », articulé autour d'un curriculum, d'un actor et d'un verifier qui « continually explore the environment, validate outcomes, and retain environment-specific knowledge ». La mémoire ainsi bâtie « is frozen and can be directly reused for downstream tasks without updating model parameters ».

L'exploration se déroule en deux temps: une phase parallèle « broad » pour couvrir la diversité des structures, puis une phase « deep » ciblée sur les cas difficiles, les contraintes cachées et les dépendances causales inconnues. Dans la répartition rapportée, GLM-5.3 tient le rôle d'actor, Kimi K3 celui de curriculum et de verifier.

C'est la deuxième piste que nous suivons cette semaine sur le versant « agents ouverts contre frontier fermé », après le garde-fou HazardAuditor publié hier. Aucune ligne du résumé ne chiffre le coût compute des phases d'exploration ni la taille des mémoires accumulées.