RSIAgent: Kimi-K3 et GLM-5.3 dépassent GPT-6 sans entraînement
TL;DR
- RSIAgent est un cadre multi-agents « training-free » qui coordonne curriculum, actor et verifier pour bâtir une mémoire réutilisable par exploration autonome.
- Sur OSWorld-v2, RSIAgent atteint 78.98% de Partial Score contre 72.60% pour GPT-6 Astra, et 84.82% sur Agent's Last Exam contre 82.26%.
- La mémoire construite est gelée et réutilisable pour des tâches en aval sans mise à jour des paramètres du modèle, selon les auteurs.
Un cadre multi-agents « training-free » permet à des modèles ouverts de dépasser GPT-6 sur deux benchmarks d'agents desktop, selon une prépublication signée Sibo Zhu et cinq co-auteurs. Sur arXiv, le système RSIAgent fait grimper le tandem Kimi-K3 / GLM-5.3 à 78.98% de Partial Score sur OSWorld-v2 contre 72.60% pour GPT-6 Astra, et à 84.82% sur Agent's Last Exam contre 82.26%.
Les auteurs présentent RSIAgent comme « a training-free multi-agent framework for recursive self-improvement through autonomous memory construction », articulé autour d'un curriculum, d'un actor et d'un verifier qui « continually explore the environment, validate outcomes, and retain environment-specific knowledge ». La mémoire ainsi bâtie « is frozen and can be directly reused for downstream tasks without updating model parameters ».
L'exploration se déroule en deux temps: une phase parallèle « broad » pour couvrir la diversité des structures, puis une phase « deep » ciblée sur les cas difficiles, les contraintes cachées et les dépendances causales inconnues. Dans la répartition rapportée, GLM-5.3 tient le rôle d'actor, Kimi K3 celui de curriculum et de verifier.
C'est la deuxième piste que nous suivons cette semaine sur le versant « agents ouverts contre frontier fermé », après le garde-fou HazardAuditor publié hier. Aucune ligne du résumé ne chiffre le coût compute des phases d'exploration ni la taille des mémoires accumulées.
Article original publié par huggingface.co
Lire l'article original →Titre original : RSIAgent: Kimi-K3 et GLM-5.3 dépassent GPT-6 sur OSWorld-v2 grâce à l'auto-amélioration récursive