ScienceBuddy imbrique deux récursions pour agents scientifiques
TL;DR
- ScienceBuddy couple deux boucles: une récursion interne fait évoluer le harness à modèle figé, une récursion externe réentraîne le modèle sous ce harness.
- Le système convertit requêtes et retours des chercheurs en tâches et rubriques d'évaluation servant de matière d'entraînement continue.
- Les auteurs documentent quatre familles de tâches scientifiques en études de cas et publient code (Gen-Verse/ScienceBuddy) et démo (science-buddy.io).
ScienceBuddy présente sa méthode d'entraînement comme une récursion emboîtée dans une récursion. Le papier publié sur Hugging Face décrit un espace de travail scientifique interactif où deux boucles distinctes tournent en parallèle: une boucle interne fait évoluer le harness d'exécution pendant que le modèle reste figé, une boucle externe réentraîne le modèle sous ce harness amélioré.
Le principe: convertir chaque interaction chercheur en matière d'entraînement. Selon les auteurs, le système « transforms researcher requests, feedback, and execution evidence into tasks and evaluation rubrics for continuous learning ». Les demandes et retours des chercheurs deviennent tâches et rubriques d'évaluation, sans constitution manuelle de dataset en amont.
Les auteurs formulent la boucle en deux mouvements: « Improves the harness with the model fixed » d'un côté, « Trains the model under the improved harness » de l'autre. Le résumé pose les deux niveaux comme co-adaptatifs: « Harness evolution shapes training experience, while model learning creates new opportunities for harness adaptation ».
L'article expose quatre familles de tâches scientifiques en études de cas, sans publier de chiffres par famille dans le résumé. Le code est mis à disposition sur GitHub et une démonstration en ligne est hébergée sur science-buddy.io. Le papier rejoint une série récente de tentatives d'auto-amélioration d'agents que nous couvrons cette semaine.
Article original publié par huggingface.co
Lire l'article original →Titre original : ScienceBuddy: self-improvement récursif dans récursif pour agents scientifiques interactifs