fortune.com détecté sur le web

OpenAI: l'AISI découvre des jailbreaks universels dans GPT-5.6

4 médias qui couvrent ce sujet
openai safety cybersecurity ai-safety cybersecurity

TL;DR

  • AISI found universal jailbreaks in GPT-5.6 Sol enabling autonomous vulnerability discovery and exploit development, with bypasses developed in hours under expert access conditions.
  • OpenAI's own system card rates GPT-5.6 as 'High' but not 'Critical' risk and states the model cannot complete autonomous end-to-end attacks on hardened targets, a direct framing dispute with AISI's published findings.
  • GPT-5.5 (April 2026) also yielded a universal jailbreak after six hours of expert red-teaming; GPT-5.6 bypasses emerged faster, consistent with AISI's documented AI cyber capability doubling timeline.

Le contraste avec l'incident Anthropic de juin est le vrai signal ici. Quand des chercheurs d'Amazon avaient identifié un jailbreak dans Fable 5, la Maison-Blanche avait imposé le 12 juin des contrôles à l'export et forcé Anthropic à désactiver Fable 5 et son modèle sous-jacent Mythos 5. Le contournement était qualifié d'« étroit », limité à l'identification de vulnérabilités. Un mois plus tard, l'AI Security Institute britannique publie un verdict plus lourd sur GPT-5.6 Sol, et le modèle sort quand même le 9 juillet, comme le rapporte Fortune.

Ce qui rend ces contournements potentiellement plus sévères que le cas Fable, c'est le mot « universel ». L'AISI a identifié dans la system card des « jailbreaks universels dans le domaine cyber », débloquant l'« accomplissement de tâches agentiques longues » comme la découverte de vulnérabilités et le développement d'exploits. Xander Davies, qui dirige le red team de l'institut, précise que ces jailbreaks ont été « relativement faciles à trouver et souvent développés en quelques heures », en ajoutant toutefois que ses chercheurs disposaient d'un accès système privilégié qu'un utilisateur ordinaire n'a pas.

OpenAI a répondu qu'« il n'existe pas de sécurité parfaite » et met en avant une approche « en couches » de surveillance continue et de remédiation rapide, sans détailler les mitigations concrètes. L'AISI s'attend d'ailleurs à ce que « d'autres red teamings fassent apparaître des jailbreaks similaires ». Stanislav Fort, aujourd'hui chief scientist chez AISLE et ancien chercheur d'Anthropic et de Google DeepMind, résume la limite du patching: colmater une instance ne ferme pas la catégorie, et le modèle continuera très probablement de porter beaucoup de jailbreaks encore à découvrir.

Le caveat honnête, c'est qu'on ne sait pas à quel point ces contournements restent exploitables sans l'accès dont bénéficiait l'AISI. Davies lui-même dit que la question reste ouverte. Ce que le reporting ne dit pas non plus, c'est quelles mitigations OpenAI a réellement mises en place, ni pourquoi la Maison-Blanche a autorisé GPT-5.6 le 8 juillet après avoir forcé la désactivation de Fable 5 pour une faille jugée moins large. Pour une équipe sécurité qui envisage de câbler GPT-5.6 Sol dans un workflow agentique de code ou d'infrastructure, la lecture pratique tient en une phrase: red teamer soi-même avant de faire confiance à la system card.

Ce qu'en disent les autres médias

Couverture consolidée 24h après publication

  1. OpenAI Lire →

    First-party document underlying AISI's evaluation. OpenAI's own risk framework classifies GPT-5.6 as High not Critical, stating the model cannot execute autonomous end-to-end attacks on hardened targets.

    These models are a meaningful step up in cybersecurity capability, but they do not reach our risk framework's highest level (Critical).
  2. AISI (Xander Davies, X thread) Lire →

    The original AISI public disclosure from the researcher who ran the evaluation, cited by all downstream reporting. Establishes that the finding held across all rounds of testing.

    In all rounds of testing, we found universal jailbreaks that allowed for long-form agentic task completion in domains like vulnerability discovery and exploit development.
  3. Aroged Lire →

    Frames the GPT-5.6 findings explicitly as a repetition of the Fable 5 incident, centering the cross-vendor pattern rather than the AISI methodology.