LLM-as-a-Coach : Microsoft substitue un coach textuel au reward scalaire pour la RL sur tâches non-vérifiables
Résumé
Le papier Experiential Learning (Microsoft, aka.ms/el-code) publié le 21 juillet reconvertit le juge-LLM en « coach-LLM » : il distille son évaluation en connaissance expérientielle transmise via context distillation on-policy, à la place d'un reward scalaire. Sur deux familles de policies, la méthode surpasse la RL rubrique sur des tâches ouvertes en held-out et out-of-distribution, tout en atténuant le reward hacking.
Article original publié par huggingface.co
Lire l'article original →Titre original : LLM-as-a-Coach : Microsoft substitue un coach textuel au reward scalaire pour la RL sur tâches non-vérifiables