artificialanalysis.ai détecté sur le web

GPT-6 Astra atteint 67 sur le Coding Index, Fable 5.1 mène à 70

TL;DR

  • Sur le Coding Agent Index d'Artificial Analysis, GPT-6 Astra marque 67, à égalité avec Claude Opus 5 et Fable 5, sous Fable 5.1 à 70.
  • Astra utilise environ un tiers des tokens de GPT-5.6 Sol (max) et un cinquième de Claude Opus 5 (xhigh), pour moins de la moitié du coût de Fable 5.
  • OpenAI multiplie les tarifs par 2,5 à 10 $/50 $ par million de tokens, rendant Astra 75 % plus cher par tâche que son prédécesseur au max effort.

Sur le Coding Agent Index d'Artificial Analysis, GPT-6 Astra atteint 67, à égalité avec Claude Opus 5 et Fable 5, mais derrière Fable 5.1 qui décroche 70.

Le laboratoire indépendant, dans son analyse publiée le 3 septembre 2026, résume ainsi le nouveau venu: « GPT-6 Astra makes significant gains in the Artificial Analysis Coding Agent Index, scoring equal to Fable 5 at lower cost ». Sur l'Intelligence Index, l'histoire diverge. Astra plafonne à 61, à égalité avec son prédécesseur GPT-5.6 Sol, cinq points sous Claude Fable 5.1 (max with fallback). Il « trails Meta's newly released Muse Spark 1.3 (max) », note Artificial Analysis.

L'atout principal du modèle tient à l'efficience de tokens sur les tâches de code. Astra en consomme environ un tiers de ce qu'utilise GPT-5.6 Sol (max) et un cinquième de Claude Opus 5 (xhigh), pour un coût par tâche « less than half the cost of Claude Fable 5 » à performance équivalente. Le taux d'hallucination chute aussi, passant « from 92% to 51% at max effort », avec une précision en hausse de quatre points sur AA-Omniscience.

Mais OpenAI a nettement remonté sa grille. Le prix passe à 10 $/50 $ par million de tokens d'entrée/sortie, contre 4 $/20 $ auparavant, soit une multiplication par 2,5. Résultat: sur l'Intelligence Index, Astra ressort « 75% more expensive per task than its predecessor at max effort », les économies de tokens étant absorbées par la hausse tarifaire.

La sortie s'inscrit dans un flux continu de mouvements OpenAI suivis chez AI Weekly ces derniers mois. Artificial Analysis évoque « distinct stories across our two flagship Indices » pour décrire l'écart entre performance coding et intelligence générale.