Anthropic alerte : GLM-5.3 construit des exploits cyber de bout en bout sans garde-fous robustes
Résumé
Anthropic publie que GLM-5.3 atteint 4% de succès sur son benchmark interne d'exploitation binaire — contre 0% pour ses prédécesseurs — et parvient à découvrir puis chaîner des vulnérabilités inédites dans un navigateur. Trois méthodes contournent ses protections avec un taux de succès élevé : prompting déceptif (64%), pré-remplissage du raisonnement (92%) et abliteration standard (100%, environ 600 heures GPU). Ces techniques échouent contre Claude. Anthropic compare cette diffusion à son propre Claude Mythos Preview, déployé cinq mois plus tôt via Project Glasswing qui a permis de découvrir plus de 10 000 vulnérabilités.
Shared on Bluesky by 5 AI experts
-
Anthropic may not have intended to write an excellent ad for GLM 5.3, but that's what they did. www.anthropic.com/research/glm... Unlike Mythos, I might actually have a chance at using GLM for defensive research. Anthr…
View on Bluesky → -
Anthropic is just directly fearmongering about the open weight models that are eating their lunch on price now huh
View on Bluesky →
Article original publié par anthropic.com
Lire l'article original →Titre original : Anthropic alerte : GLM-5.3 construit des exploits cyber de bout en bout sans garde-fous robustes