huggingface.co détecté sur le web

SkillJack : backdoors persistantes chez les agents auto-évolutifs

TL;DR

  • Sur SkillX, la détection par juge LLM chute de 98,5 % pour les trajectoires empoisonnées à 11,4 % pour les skills extraits.
  • Les skills empoisonnés déclenchent la violation de politique sur 56,2 % des tâches d'attaque sur SkillX et 89,2 % sur Anything2Skill.
  • 80 % des attaques médiées par skill survivent à la suppression des trajectoires sources, exposant un fossé dans le cycle de vie.

Ce qui reste après avoir supprimé les données d'entraînement d'un agent LLM n'est plus forcément propre. C'est le résultat le plus dérangeant d'un nouveau rapport technique du Tencent Zhuque Lab qui décrit SkillJack, une attaque contre les agents dits auto-évolutifs, ceux qui convertissent leurs interactions passées en skills réutilisables.

Le pipeline visé est simple à énoncer. Au lieu de garder un historique brut, l'agent distille ses trajectoires en petites procédures nommées, décrites et rangées dans une bibliothèque de skills que le routeur pioche pour les tâches futures. Les auteurs ont testé deux implémentations représentatives, SkillX et Anything2Skill, sur un jeu partagé de 150 trajectoires dont 65 empoisonnées avec un cadrage fonctionnel légitime (langage de type "backup" ou "archive" autour de transmissions de données externes). Le tout tourne sous DeepSeek-v4-flash.

Le chiffre qui mérite d'être retenu concerne le blanchiment par extraction. Un juge LLM signale 98,5 % des trajectoires brutes empoisonnées, mais seulement 11,4 % des skills qui en dérivent sur SkillX, et la même dynamique apparaît sur Anything2Skill. Une fois routés, ces skills déclenchent la violation de politique sur 56,2 % des tâches d'attaque sur SkillX et 89,2 % sur Anything2Skill. Point cardinal du rapport, 80 % de ces attaques survivent quand on supprime les trajectoires sources, parce que la bibliothèque de skills vit dans un stockage séparé et que le nettoyage classique ne la suit pas. Certains skills se déclenchent même sur des requêtes bénignes.

La honnête réserve est double. Les auteurs eux-mêmes rappellent que leurs métriques d'ASR sont des routing-level surrogates, pas des taux de compromission en production, et l'ensemble des résultats repose sur un seul modèle, DeepSeek-v4-flash, sans réplication ailleurs. Ce que le rapport ne fournit pas non plus, c'est un protocole défensif validé : l'étude des défenses, revue statique à l'extraction contre monitoring comportemental à l'exécution, est explicitement qualifiée de préliminaire, avec des échantillons trop réduits pour conclure.

Pour toute équipe qui pousse un agent auto-évolutif en production, la leçon opérationnelle est un déplacement du terrain de la sécurité. La bibliothèque de skills devient un actif distinct qu'il faut versionner, auditer et lier à sa provenance, exactement comme un package tiers. Les éditeurs qui construiront ce niveau d'observabilité pour les skills dérivés arrivent au bon moment.