openai.com détecté sur le web

OpenAI calque des « safety cases » aviation sur l'entraînement RL

OpenAI Safety ai-business

TL;DR

  • OpenAI publie « Towards Safety Cases for Frontier AI Training », un cadre de documentation à produire avant tout entraînement RL frontière.
  • Trois piliers techniques structurent le safety case: alignment training, containment et monitoring, avec un monitoring « fail-closed » par défaut.
  • Un « dissent » doit être rédigé par une autre équipe, et Head of Safety, Chief Scientist et le lead recherche disposent chacun d'un droit de veto individuel.

Le document ouvre en admettant que ce qu'il décrit n'existe pas encore: OpenAI présente ses « safety cases » comme "an aspirational north star", pas une procédure déjà en vigueur. Le texte publié par OpenAI propose qu'avant tout entraînement RL frontière une équipe rédige une argumentation structurée, étayée par des preuves, expliquant pourquoi le run est acceptable. La référence est explicite: aviation et énergie nucléaire, deux secteurs où un opérateur doit démontrer formellement la sûreté d'un système avant sa mise en service.

Le cadre s'organise autour de trois piliers techniques: alignment training, containment, monitoring. Côté alignement, l'idée est de calibrer les scorers automatisés et d'empêcher "automated scorers from accessing chain-of-thought outputs to prevent models from learning to evade monitoring". Le containment prescrit des sandboxes multi-couches, du red teaming sur les checkpoints, une limitation des canaux à haut débit entre échantillons, et un stockage write-once des transcripts d'agents. Le monitoring doit tomber « fail-closed »: si la surveillance ne répond pas, un run ne peut pas démarrer, et une alerte laissée sans réponse durant la nuit déclenche une pause automatique.

La partie gouvernance est celle qui déplace le curseur. Un membre d'une autre équipe doit rédiger un « dissent » contre le safety case, que l'équipe d'entraînement est tenue d'adresser. Le run est ensuite revu par plusieurs cadres, nommément le lead de l'organisation recherche, le Head of Safety et le Chief Scientist, chacun disposant d'un droit de veto individuel. Le senior leader qui porte le run répond ensuite du safety case et de la réponse aux incidents dans son évaluation de performance.

OpenAI concède la limite: atteindre pour l'IA le niveau de rigueur des safety cases de l'aviation ou du nucléaire reste difficile, la complexité augmentant à chaque palier de capacité.

Le texte paraît le même jour qu'une autre annonce safety d'OpenAI dans notre suivi, liée à un incident sur un portail de santé australien.