Tsinghua publie SAO, un cadre asynchrone d'apprentissage par renforcement déjà utilisé pour l'entraînement du modèle open source GLM-5.2 (750B-A40B)
Résumé
Zhenyu Hou, Jie Tang et Yuxiao Dong (Tsinghua) proposent Single-rollout Asynchronous Optimization (SAO), qui remplace le sampling en groupe de GRPO par un rollout unique par prompt et introduit un clipping strict au niveau token pour stabiliser l'apprentissage asynchrone sur mille pas. SAO surpasse GRPO et ses variantes sur SWE-Bench Verified, BeyondAIME et IMOAnswerBench, et sert déjà de pipeline de RL pour l'entraînement du modèle open GLM-5.2.
Article original publié par huggingface.co
Lire l'article original →Titre original : Tsinghua publie SAO, un cadre asynchrone d'apprentissage par renforcement déjà utilisé pour l'entraînement du modèle open source GLM-5.2 (750B-A40B)