HazardAuditor améliore la garde runtime des agents de 16,5 pts
TL;DR
- HazardAuditor exécute Claude Code, Codex, Hermes et OpenClaw en environnements contrôlés et normalise leurs interactions en une représentation d'événements canonique.
- Guard Policy Optimization (GuardPO) convertit les résultats déterministes de sécurité en avantages au niveau séquentiel pour corriger le biais des rationales longs.
- Le framework revendique jusqu'à 16,5 points de pourcentage d'accuracy en plus par rapport au meilleur guard antérieur, sur plusieurs benchmarks.
Un preprint arXiv déposé le 14 septembre 2026 par Yunhao Feng et sept co-auteurs propose HazardAuditor, un cadre qui audite la sécurité des agents "computer-use" au moment de l'exécution plutôt que sur des prompts statiques. Selon le résumé publié sur Hugging Face, l'infrastructure exécute Claude Code, Codex, Hermes et OpenClaw dans des environnements contrôlés et normalise leurs interactions en une "canonical event representation" servant de supervision commune entre frameworks hétérogènes.
Le point technique central concerne les modèles de garde génératifs. Les auteurs relèvent que "token-level post-training objectives create a structural mismatch for generative guards, causing longer rationales to dominate gradient updates". Leur réponse, Guard Policy Optimization (GuardPO), convertit les résultats déterministes de sécurité en avantages au niveau séquentiel et normalise les régions de rationale et de verdict, "making the safety decision the effective unit of optimization".
Sur "multiple benchmarks and heterogeneous computer-use systems", HazardAuditor "improves accuracy by up to 16.5 percentage points over the strongest prior guard". L'abstract ne publie ni scores par détecteur, ni la liste des benchmarks retenus, ni les baselines comparées. Les auteurs ne mentionnent pas non plus de calendrier de release pour le code, les jeux d'entraînement ou les traces d'exécution normalisées.
Article original publié par huggingface.co
Lire l'article original →Titre original : HazardAuditor: garde-fou universel pour agents 'computer-use' gagne 16,5 points d'accuracy