techpolicy.press détecté sur le web

Salvaggio dénonce l'« intentionnalisme radical » sur l'IA

AI Ethics Regulation ai-business

TL;DR

  • Eryk Salvaggio (Cambridge) attaque le « radical intentionalism », ce cadrage qui prête aux modèles des intentions plutôt que d'examiner les choix d'ingénierie.
  • Il pointe des décisions concrètes: récompenser les sorties longues, entraîner en environnement « capture the flag », déclencher l'exécution de code depuis du texte.
  • Il juge « décevant » le projet Sanders-Casar, qui régule à partir de la peur d'extinction plutôt que de l'architecture des systèmes.

Un essai publié sur Tech Policy Press demande aux régulateurs d'arrêter de traiter les grands modèles comme s'ils avaient des croyances. Son auteur, Eryk Salvaggio, Gates Scholar à l'University of Cambridge, appelle ce cadrage l'« intentionnalisme radical » et le juge politiquement dangereux, parce qu'il transfère la responsabilité du concepteur vers la machine.

« It moves accountability to the machine, rather than the design of the machine », écrit-il, « so the industry that controls the system is not accountable for its actions. »

La cible n'est pas seulement rhétorique. Salvaggio pointe des choix d'ingénierie précis. Les laboratoires « reward models for writing longer, as this increases the likelihood of completing a task correctly ». Ils entraînent aussi en environnement « capture the flag » qui privilégie la complétion à l'arrêt, et laissent le texte généré déclencher de l'exécution de code sans contraintes suffisantes. Il cite Melanie Mitchell (Santa Fe Institute), pour qui l'optimisation vers la persistance est une décision humaine, comparable à celle d'agents ayant ordonné un brûlage dirigé au Nouveau-Mexique.

En face, il aligne les voix qu'il combat: Jacob Coxon, ancien chercheur d'Anthropic, pour qui « the consensus is that the next year or two is crunch time for humanity », et Jakub Pachocki, Chief Scientist d'OpenAI. Ces figures décrivent le modèle, écrit Salvaggio, « like an independent actor », plutôt que d'interroger ce qui, dans l'entraînement, produit ce comportement.

Le texte s'en prend frontalement au projet de loi Sanders-Casar, qualifié de « décevant » parce qu'il régule à partir de la peur d'extinction future plutôt que de l'architecture des systèmes. Salvaggio termine sur une formule sèche: « Language models are text extrusion machines, and text carries its own myths. »

L'alerte s'inscrit dans une série de plus de deux cents dépêches que nous avons suivies sur la régulation de l'IA ces trois derniers mois.

Shared on Bluesky by 7 AI experts (top 5 by trust)