huggingface.co détecté sur le web

UT Austin et Together AI publient ISO, RLVR 2,7× plus rapide

fine-tuning open source ai-business

TL;DR

  • Sur Qwen3-8B-Base entraîné sur DeepMath-103K, ISO-AdamW atteint la précision 0,495 d'AdamW en 100 étapes contre 270, soit 2,7× moins d'étapes.
  • Le cadre ISO fige les valeurs singulières Σ₀ du modèle de base et n'optimise que les frames U et V, re-projetés par rétraction polaire sur la variété de Stiefel.
  • Le surcoût de la rétraction polaire est mesuré à environ 86 secondes sur un pas de 1200 secondes, soit environ 7 % du temps par étape RLVR.

Une équipe menée par UT Austin, avec des contributions de UIUC, Together AI, ELLIS Institute Tübingen, Emory et Recursive Superintelligence Inc, a publié sur Hugging Face un travail qui repense la brique optimiseur du reinforcement learning with verifiable rewards (RLVR). L'idée centrale, baptisée « spectral inheritance », part d'une observation empirique : quand on fine-tune un modèle base par RLVR sur des tâches de raisonnement, les valeurs singulières Σ₀ du modèle de base bougent très peu, l'essentiel du changement utile se joue dans les frames singuliers gauche U et droit V.

Les auteurs en tirent une conséquence opérationnelle. Plutôt que de laisser AdamW pousser tout le tenseur de poids dans le vide, ils figent Σ₀ pendant l'entraînement et n'apprennent que U et V, chaque itération étant reprojetée sur la variété de Stiefel via une rétraction polaire. Sur Qwen3-8B-Base entraîné sur DeepMath-103K, ISO-AdamW atteint la précision de 0,495 obtenue par AdamW standard en 100 étapes seulement, contre 270 pour la baseline, soit un facteur 2,7× d'étapes en moins pour la même cible. Un pendant offline, ISO-Merger, fusionne des specialists RLVR partageant la même base « sans post-merge data, rollouts, or on-policy distillation », ce qui intéressera les équipes qui empilent des experts coding, maths et tool use.

Pourquoi c'est intéressant hors du cadre académique : le RLVR coûte cher parce que chaque étape est dominée par la génération de rollouts. Diviser par 2,7 le nombre d'étapes nécessaires, si le résultat tient, se traduit à peu près directement en facture GPU divisée d'autant. Les auteurs mesurent d'ailleurs le surcoût de la rétraction polaire à environ 86 secondes sur un pas total d'environ 1200 secondes, soit environ 7 %, une fraction jugée absorbable dans un pipeline RL asynchrone.

Le honnête caveat : les résultats couvrent la famille Qwen3-Base (1.7B, 4B, 8B) sur du raisonnement mathématique, plus un run coding sur DeepSeek-R1-Distill-Qwen-1.5B. Ce que le papier ne fournit pas, c'est un comportement sur Llama ou Mistral, une étude au-delà de trois experts pour la fusion, ni un stress-test sur des récompenses bruitées. Prenez donc le 2,7× comme un chiffre reporté sur un banc précis, pas comme une garantie universelle.

Pour un lab qui budgétise ses runs RLVR, ou pour un provider de post-training comme Together AI (co-auteur du papier), la question à suivre est celle de la reproduction hors Qwen dans les semaines qui viennent. Si ça tient sur d'autres familles, l'optimiseur par défaut de la couche RL n'est plus AdamW.