Papier DRACO : rubriques dynamiques pour l'assignation de crédit fine dans le training d'agents long-horizon
Résumé
DRACO s'attaque au principal frein du RL sur agents long-horizon : l'assignation de crédit granulaire. Le papier introduit des rubriques dynamiques qui pondèrent chaque étape d'une trajectoire selon la trace observée, plutôt qu'une récompense terminale unique. Frontière de Pareto améliorée sur les tâches d'agent visées, publié le 4 septembre sur arXiv/Hugging Face.
Article original publié par huggingface.co
Lire l'article original →Titre original : Papier DRACO : rubriques dynamiques pour l'assignation de crédit fine dans le training d'agents long-horizon