Tikhonov et al. : les Transformers superposent deux flux dans les LLM
TL;DR
- Le papier avance la « Superposition Linearity Hypothesis » : combiner linéairement deux flux d'entrée produit une superposition des distributions de token suivant.
- La propriété serait intrinsèque à l'architecture Transformer et diminuerait au fil du pré-entraînement, tout en restant restaurable par un fine-tuning léger.
- Une procédure de décodage guidé désenchevêtre les sorties superposées et génère deux continuations cohérentes en une seule passe forward.
Neuf chercheurs, parmi lesquels Pavel Tikhonov, Anton Korznikov, Matvey Mikhalchuk, Ivan Oseledets et Elena Tutubalina, soutiennent dans un papier déposé sur arXiv que les grands modèles de langage, malgré leurs composants « highly non-linear », se comportent de façon linéaire dans un régime précis : quand on combine linéairement deux flux de texte en entrée, le modèle sort une superposition des distributions de token suivant de chacun.
Les auteurs baptisent le phénomène la « Superposition Linearity Hypothesis ». Ils l'annoncent comme un attribut de l'architecture Transformer plutôt qu'un produit de l'entraînement. « we observe that it tends to diminish as pretraining progresses », écrivent-ils dans le résumé. Un fine-tuning léger suffirait à restaurer la propriété, en « significantly reducing the divergence between the predicted next-token distribution and the average of the individual next-token distributions ».
L'aspect le plus tangible est un protocole de décodage. Le résumé décrit une procédure guidée qui « disentangles superposed outputs, enabling the simultaneous generation of two coherent continuations from a single forward pass ». Deux textes distincts produits par une même passe forward, donc, si le résultat tient hors du cadre expérimental.
Le résumé publié ne précise ni les familles de modèles couvertes, ni les mesures de qualité par continuation, ni jusqu'à combien de flux la superposition se maintient. C'est un signal pour la communauté interprétabilité mécanistique plus qu'un résultat prêt pour la production, et il arrive dans une salve de publications sur l'IA générative que notre veille suit de près.
Article original publié par huggingface.co
Lire l'article original →Titre original : Un papier arXiv démontre que les Transformers superposent linéairement deux « pensées » simultanées