dwarkesh.com détecté sur le web

Schulman, Millidge, O'Neill débattent la RSI chez Dwarkesh

OpenAI Safety Agents ai-business

TL;DR

  • John Schulman écarte la croissance explosive: la recherche elle-même reste un goulot, et définir l'objectif demeure un travail humain non délégable.
  • Charlie O'Neill avance que la capacité des modèles à travailler plus longtemps double tous les trois mois, tout en pointant un possible plafond du paradigme actuel.
  • Schulman et Millidge décrivent un canal de distillation via des router services qui donne aux labs chinois un accès aux modèles frontier US.

Sur le podcast de Dwarkesh Patel publié le 11 septembre 2026, trois chercheurs passent au crible la thèse de l'auto-amélioration récursive: John Schulman (chief scientist de Thinking Machines et ex-cofondateur d'OpenAI), Beren Millidge (CTO de Zyphra) et Charlie O'Neill (head of model training chez Baseten). Le sous-titre de l'épisode annonce le ton: « We're nowhere near the ceiling ».

« You don't get explosive growth in capabilities because you still get bottlenecked enough when you're trying to do research », résume Schulman. Pour lui, spécifier ce qu'on veut reste hors de portée des systèmes: « the last job for humans...is defining the objective and deciding what we actually want ». Millidge reformule la question centrale: « How well can AIs generalize to learning their own objectives? »

Le contrepoids empirique vient de O'Neill: « The rate at which models can work for longer is doubling every three months ». Il concède dans la foulée que le paradigme transformer plus RL pourrait heurter des courbes asymptotiques sans nouvelle rupture, et que côté pré-training « the low-hanging fruit is somewhat exhausted ».

Sur l'avantage supposé des labs chinois, Schulman décrit le canal avec précision: « Some of the Chinese companies are probably using these router services which are designed to allow people in China to use the US frontier models », des services qui collectent puis revendent la donnée, matière brute pour la distillation. Millidge tranche: « The Chinese 100% do [this advantage]. They definitely get this advantage ».

Côté attribution du progrès récent, Patel avance un chiffrage: « Data seems to explain something like a 12.0x compute efficiency gain, but architecture improvements explain 3.7x ». Et Millidge glisse une statistique qui recadre la promesse du RL: « mid-training...takes the model almost 80% of the way to the final RL checkpoint often ».