Zhang Yiming (ByteDance) exclut la distillation d'IA rivales
TL;DR
- Lors d'un all-hands en juillet, Zhang Yiming a dit aux équipes IA que ByteDance ne recourra pas à la distillation pour accélérer ses modèles.
- La division Seed de ByteDance aurait posé dès le départ le principe de 'ne pas faire de distillation', visant le niveau global top tier.
- Zhang Yiming assume que ce choix puisse laisser ByteDance en retrait de ses rivaux chinois domestiques à court terme.
Le fondateur de ByteDance a tenu un discours qui détonne dans l'écosystème IA chinois. Selon The Information, Zhang Yiming a expliqué à ses équipes IA lors d'un all-hands en juillet que le groupe ne recourra pas à la distillation de modèles concurrents pour accélérer ses propres capacités, même si cela signifie prendre du retard sur ses rivaux domestiques à court terme.
La distillation consiste à utiliser les sorties d'un modèle plus performant pour améliorer un modèle plus faible. La technique est devenue un point de controverse dans la course à l'IA, précisément parce qu'elle raccourcit le chemin en s'appuyant sur le travail des autres. La division Seed de ByteDance aurait posé dès le départ le principe de 'ne pas faire de distillation', selon un employé cité dans le reportage: l'ambition affichée est d'atteindre le niveau 'global top tier', voire l'état de l'art, un objectif jugé difficile à tenir en distillant.
L'implication opérationnelle est lourde. Un employé résume la logique dans le même reportage: si toutes les données doivent être synthétisées, achetées et nettoyées en interne, il faut une équipe massive pour tenir le rythme. C'est un pari coûteux, qui suppose que la crédibilité d'un modèle bâti from scratch vaut la peine du différentiel de temps et de dépense par rapport à ceux qui empruntent des raccourcis.
Le caveat honnête est que le reportage repose largement sur des sources internes anonymes, et que la manière concrète dont ce principe sera vérifié à travers toutes les équipes IA du groupe n'est pas explicitée. On ne sait pas davantage si la règle s'étend aux modèles open source disponibles, ni quel plan de compute et de données ByteDance mobilise pour combler l'écart de vitesse qu'il assume publiquement.
Ce qui rend le signal intéressant à suivre, c'est ce qu'il dit du positionnement de ByteDance face à des clients et régulateurs occidentaux de plus en plus méfiants sur la provenance des poids et des données d'entraînement des modèles chinois. Un acteur qui affirme publiquement bâtir sans distiller les autres construit une carte de crédibilité différente de celle de ses concurrents domestiques, à condition de tenir sa promesse dans les faits.
Article original publié par theinformation.com
Lire l'article original →Titre original : The Information : le fondateur de ByteDance Zhang Yiming interdit à ses équipes IA de distiller les modèles rivaux