UT Austin et Together AI publient ISO, RLVR 2,7× plus rapide
TL;DR
- Sur Qwen3-8B-Base entraîné sur DeepMath-103K, ISO-AdamW atteint la précision 0,495 d'AdamW en 100 étapes contre 270, soit 2,7× moins d'étapes.
- Le cadre ISO fige les valeurs singulières Σ₀ du modèle de base et n'optimise que les frames U et V, re-projetés par rétraction polaire sur la variété de Stiefel.
- Le surcoût de la rétraction polaire est mesuré à environ 86 secondes sur un pas de 1200 secondes, soit environ 7 % du temps par étape RLVR.
Une équipe menée par UT Austin, avec des contributions de UIUC, Together AI, ELLIS Institute Tübingen, Emory et Recursive Superintelligence Inc, a publié sur Hugging Face un travail qui repense la brique optimiseur du reinforcement learning with verifiable rewards (RLVR). L'idée centrale, baptisée « spectral inheritance », part d'une observation empirique : quand on fine-tune un modèle base par RLVR sur des tâches de raisonnement, les valeurs singulières Σ₀ du modèle de base bougent très peu, l'essentiel du changement utile se joue dans les frames singuliers gauche U et droit V.
Les auteurs en tirent une conséquence opérationnelle. Plutôt que de laisser AdamW pousser tout le tenseur de poids dans le vide, ils figent Σ₀ pendant l'entraînement et n'apprennent que U et V, chaque itération étant reprojetée sur la variété de Stiefel via une rétraction polaire. Sur Qwen3-8B-Base entraîné sur DeepMath-103K, ISO-AdamW atteint la précision de 0,495 obtenue par AdamW standard en 100 étapes seulement, contre 270 pour la baseline, soit un facteur 2,7× d'étapes en moins pour la même cible. Un pendant offline, ISO-Merger, fusionne des specialists RLVR partageant la même base « sans post-merge data, rollouts, or on-policy distillation », ce qui intéressera les équipes qui empilent des experts coding, maths et tool use.
Pourquoi c'est intéressant hors du cadre académique : le RLVR coûte cher parce que chaque étape est dominée par la génération de rollouts. Diviser par 2,7 le nombre d'étapes nécessaires, si le résultat tient, se traduit à peu près directement en facture GPU divisée d'autant. Les auteurs mesurent d'ailleurs le surcoût de la rétraction polaire à environ 86 secondes sur un pas total d'environ 1200 secondes, soit environ 7 %, une fraction jugée absorbable dans un pipeline RL asynchrone.
Le honnête caveat : les résultats couvrent la famille Qwen3-Base (1.7B, 4B, 8B) sur du raisonnement mathématique, plus un run coding sur DeepSeek-R1-Distill-Qwen-1.5B. Ce que le papier ne fournit pas, c'est un comportement sur Llama ou Mistral, une étude au-delà de trois experts pour la fusion, ni un stress-test sur des récompenses bruitées. Prenez donc le 2,7× comme un chiffre reporté sur un banc précis, pas comme une garantie universelle.
Pour un lab qui budgétise ses runs RLVR, ou pour un provider de post-training comme Together AI (co-auteur du papier), la question à suivre est celle de la reproduction hors Qwen dans les semaines qui viennent. Si ça tient sur d'autres familles, l'optimiseur par défaut de la couche RL n'est plus AdamW.
Article original publié par huggingface.co
Lire l'article original →Titre original : UT Austin et Together AI publient ISO, une pile d'optimisation RLVR qui converge 2,7× plus vite qu'AdamW