SWE-Pruner Pro élague le contexte agent, jusqu'à 39 % de tokens
TL;DR
- SWE-Pruner Pro branche une petite tête sur les états cachés du modèle et décide ligne par ligne quelles sorties d'outil conserver, sans scoreur externe.
- Sur SWE-QA-Pro avec Qwen3-Coder-Next, la méthode réduit la consommation de tokens de 39,4 % tout en gagnant +0,24 point sur le score du juge.
- Sur MiMo-V2-Flash, elle relève de +3,8 % le taux de résolution sur SWE-Bench Verified et de +2,2 points la précision Oolong.
Les agents codeurs modernes brûlent l'essentiel de leur budget de tokens sur les sorties d'outils qu'ils relisent tour après tour: sur SWE-Bench Verified, les commandes de lecture de fichiers représentent plus de 70 % des tokens consommés par Mini-SWE-Agent adossé à Claude Sonnet 4.5, selon les mesures citées dans le papier SWE-Pruner Pro. C'est ce coût que l'équipe de Shanghai Jiao Tong University attaque, avec une idée simple: le modèle sait déjà ce qui est important.
Leur trouvaille tient en une phrase: quand un agent lit une sortie d'outil, son backbone encode déjà, dans ses représentations internes, quelles lignes serviront ensuite. Plutôt que de brancher un second modèle de scoring conditionné sur une requête d'intention (comme le faisait SWE-Pruner original), SWE-Pruner Pro attache une petite tête directement sur les états cachés de la dernière couche du backbone gelé, avec un embedding conditionné par le nombre de lignes et une perte focale rééquilibrée par échantillon. La tête décide ligne par ligne quoi garder, et la version élaguée remplace la sortie brute au tour suivant.
Les chiffres, sur deux backbones open-weight (MiMo-V2-Flash, 309 milliards de paramètres MoE avec 15 milliards actifs, et Qwen3-Coder-Next, 80 milliards MoE avec 3 milliards actifs, tous deux à 256K de contexte) et quatre benchmarks, sont cohérents. La méthode économise jusqu'à 39,4 % de tokens sur SWE-QA-Pro avec Qwen3, 30,1 % sur Oolong long-contexte avec MiMo, et gagne dans le même mouvement +3,8 % de taux de résolution sur SWE-Bench Verified côté MiMo et +2,2 points de précision sur Oolong. Le surcoût de latence de la tête s'établit à 15,0 % de wall time agrégé, médian 14,7 %.
La mise en garde honnête est que la recette exige un accès aux états cachés: elle ne s'applique donc qu'aux modèles open-weight, pas aux API fermées. Sur Qwen3-Coder-Next et SWE-Bench Verified, tous les pruners évalués, y compris celui-ci, dégradent légèrement le taux de résolution par rapport au baseline non élagué (SWE-Pruner Pro perd 1,2 point). Les étiquettes d'entraînement viennent d'un annotateur LLM (Claude Sonnet 4.6) et le juge d'évaluation est GPT-5.4-mini, deux dépendances qui méritent d'être notées avant de généraliser.
Ce que ce résultat suggère pour la suite, c'est un déplacement du curseur: si le signal de pertinence est déjà dans les représentations que le modèle forme au passage, une part du travail de gestion de contexte n'a pas besoin d'un modèle supplémentaire, seulement d'une lecture. Les fournisseurs d'inférence open-weight et les équipes qui font tourner des agents multi-turn en production sont les premiers gagnants.
Article original publié par huggingface.co
Lire l'article original →Titre original : SWE-Pruner Pro : l'agent codeur élaguer lui-même son contexte, jusqu'à 39 % de tokens économisés