Patel-Han: 12× d'efficacité pré-entraînement viennent des données
TL;DR
- Sur 2019-2025 à 1e19 FLOPs, les données apportent 12,0× de gains d'efficacité contre 3,7× pour les modèles, soit un ratio de 3,24×.
- En rythme annuel: 1,51× côté données, 1,24× côté modèles, 1,57× combinés, en dessous de l'estimation antérieure d'Anson Ho de 3×/an.
- Les auteurs préviennent que leurs expériences à petite échelle sous-estiment probablement les gains où l'architecture débloque le compute utilisable.
3,24×. C'est l'écart d'efficacité pré-entraînement que Dwarkesh Patel et Jerry Han attribuent aux données plutôt qu'aux modèles sur la période 2019-2025, dans un billet mis en ligne le 8 septembre.
Les deux auteurs ont entraîné des paires croisées de recettes de modèles et de corpus « year-representative », de GPT-2 avec OpenWebText en 2019 à OLMo-2 avec UltraFineWeb en 2025, jusqu'à 1e19 FLOPs. Le résultat brut : « 3.24x more compute efficiency gains have come from data improvements rather than model improvements (12.0x for data and 3.7x for models) », au budget de 1e19 FLOPs. Ramené à un rythme annuel, cela donne 1,51× côté données, 1,24× côté modèles, et un combiné de 1,57×, nettement sous les 3×/an d'Anson Ho et al., dont l'intervalle de confiance à 95% s'étalait de 1,5× à 64×.
Les auteurs refusent de disqualifier la recherche sur l'architecture. « Their main contribution was not necessarily compute efficiency...Rather, it was making larger amounts of compute usable in the first place », écrivent-ils, filant l'analogie d'un porte-conteneurs qui ne va pas plus vite qu'un voilier mais peut transporter « thousands of tons of cargo (analogous to hundreds of trillions of tokens of pretraining data) ». Le benchmark utilisé, OLMES, agrège « 10 different relatively easy benchmarks, mostly multiple choice QA ».
Et un aveu tenu court, en propres termes : « even our experiment was done at an extremely small scale. We definitely think it's plausible that there is something we missed. » Ils précisent n'avoir testé ni collectes supplémentaires, ni données synthétiques, ni données générées par experts humains.
OLMo-2 et UltraFineWeb, deux briques du camp open-source suivi ici, servent de terminus 2025 : un choix qui rend le résultat reproductible mais ancre les conclusions à des artefacts publics, pas aux corpus fermés des labos frontier.
Shared on Bluesky by 1 AI expert
Article original publié par dwarkesh.com
Lire l'article original →Titre original : Dwarkesh Patel : 12× des gains d'efficacité pré-entraînement 2019-2025 viennent des données, pas des modèles