Willison : Astra low bat GPT-5.6 Sol au benchmark pélican SVG
TL;DR
- Selon Simon Willison, le niveau de raisonnement le plus bas de GPT-6 Astra produit déjà un pélican SVG supérieur à la meilleure sortie de GPT-5.6 Sol.
- Astra est facturé 10 $ par million de tokens d'entrée et 50 $ en sortie, contre 5 $ et 30 $ pour Sol, mais consomme moins de tokens.
- Astra et Luna consomment tous deux 16 tokens d'entrée pour le même prompt, quand Sol et Terra en consomment 26.
Sur son blog, Simon Willison a repassé son benchmark préféré — dessiner un pélican à vélo en SVG — sur GPT-6 Astra, et l'a comparé aux trois déclinaisons de GPT-5.6 : Sol, Terra et Luna.
Son verdict tient en une phrase : « The Astra pelicans are much better ». Même le niveau de raisonnement le plus bas d'Astra sort un pélican plus reconnaissable que la meilleure sortie de Sol, qui reste selon lui « still pretty clearly a bunch of abstract shapes ». Côté prix, Astra affiche 10 $ le million de tokens d'entrée et 50 $ en sortie, soit le double de Sol (5 $ / 30 $) ; mais Willison note que le modèle consomme nettement moins de tokens, si bien que la génération en raisonnement bas revient à 9,55 cents.
Un détail intrigue l'auteur. Astra et Luna consomment tous deux 16 tokens d'entrée pour le même prompt, quand Sol et Terra en consomment 26. De quoi se demander, écrit-il, « whether Astra and Luna are more related to each other than OpenAI let on ». Willison relève aussi une limite du modèle : en dessous du raisonnement maximal, Astra « doesn't reliably get the pelican legs on both sides of the frame ».
C'est notre deuxième signal en quelques jours autour du lancement d'Astra, après le papier de Fortune rapportant des métriques d'évaluation discrètement rehaussées après le lancement.
Article original publié par simonwillison.net
Lire l'article original →Titre original : Simon Willison compare les pélicans SVG : GPT-6 Astra low bat tous les niveaux de GPT-5.6 Sol