openai.com détecté sur le web

OpenAI triple son score ARC-AGI-3 avec deux réglages d'API

openai agents ai-business

TL;DR

  • Avec le harnais officiel d'ARC-AGI-3, GPT-5.6 Sol n'obtient que 7,8 %, contre 38,3 % en réactivant le raisonnement retenu et la compaction via la Responses API.
  • La configuration passe aussi devant Claude Opus 5 d'Anthropic, crédité de 30,2 % sur le même benchmark public.
  • OpenAI affirme que ces deux réglages produisent environ trois fois le score avec six fois moins de tokens de sortie.

Un même modèle, un même benchmark, deux scores qui n'ont presque rien à voir. C'est le point de départ de la note publiée par OpenAI sur ARC-AGI-3, où GPT-5.6 Sol passe de 7,8 % dans le harnais officiel à 38,3 % dès que deux réglages de la Responses API sont activés: le raisonnement retenu, qui préserve la chaîne de pensée d'un pas à l'autre, et la compaction, qui résume le contexte au lieu de le tronquer.

Avec cette configuration, OpenAI affirme aussi dépasser Claude Opus 5 d'Anthropic, crédité de 30,2 % sur le même ensemble public, comme le rapporte The Decoder. Le tout, selon la société, avec environ six fois moins de tokens de sortie. La lecture technique est intéressante: dans le harnais officiel, la mémoire de travail du modèle était effacée entre les actions, ce qui l'obligeait à reconstruire sa stratégie à chaque coup. Rendre cette mémoire persistante côté API change la nature de la tâche pour le modèle.

Là où l'histoire devient inconfortable, c'est sur la question de ce qu'un benchmark est censé mesurer. François Chollet, cofondateur d'ARC Prize, distingue les réglages d'API génériques disponibles à tous les utilisateurs, qu'il considère comme acceptables, et les harnais 'sur mesure' conçus spécifiquement pour ARC-AGI-3, qu'il rejette. ARC Prize, dans un message sur X, rappelle de son côté que ses scores vérifiés utilisent une approche 'no harness' précisément pour éviter le ciblage, volontaire ou non, spécifique à un fournisseur.

La mise en garde honnête est que le 38,3 % reste un résultat auto-déclaré par OpenAI sur l'ensemble public d'ARC-AGI-3, sans vérification indépendante sur le jeu privé, et qu'Anthropic conserve son avantage sur le tableau officiel. Ce que la publication ne dit pas non plus, c'est ce que donnerait un rerun symétrique où les mécanismes de mémoire équivalents d'autres fournisseurs seraient également activés.

Ce qu'il faut en retenir pour les équipes qui construisent des agents à long horizon: la façon dont on garde le raisonnement d'un pas à l'autre, et la façon dont on compacte l'historique quand la fenêtre déborde, sont maintenant des leviers de performance de premier ordre, pas des détails d'implémentation. Et pour tous ceux qui achètent ou classent des modèles sur la base d'un score de benchmark, la vraie ligne à exiger désormais est la configuration précise qui a produit le chiffre.

Shared on Bluesky by 2 AI experts