huggingface.co détecté sur le web

Pick Your Poison: SAILS fait passer les backdoors LLM de 3 % à 80 % de succès juste en changeant le corpus

Résumé

Les auteurs montrent qu'à modèle, données propres et volume de poison fixés, le taux de succès d'une attaque backdoor sur LLM varie de 3 à 80 % selon le seul choix du corpus empoisonné. Leur méthode SAILS apprend un scorer de sets sur quelques centaines de fine-tunes, classe des millions de candidats et audite un sous-ensemble restreint. Elle gagne 30 points de pourcentage de succès en held-out sur les meilleures baselines influence-based.