Artificial Analysis : Claude Sonnet 5.5 second à 2 pts d'Opus 5.5
TL;DR
- Sonnet 5.5 marque 56 sur l'Intelligence Index d'Artificial Analysis, deux points derrière Opus 5.5 (max), devant GPT-6 Astra.
- À effort max, le modèle consomme ~193k tokens de sortie par tâche, ~60% de plus qu'Opus 5.5 et environ sept fois GPT-6 Astra.
- Prix identique à Sonnet 5 (2/10$ par million entrée/sortie), mais coût par tâche à 7,60$, ~50% au-dessus de Sonnet 5.
Claude Sonnet 5.5 obtient 56 points sur l'Intelligence Index d'Artificial Analysis, deux points derrière Opus 5.5 (max) et devant GPT-6 Astra. Le benchmark indépendant place le modèle Anthropic, sorti le 28 septembre 2026, en deuxième position de son classement.
Sur les évaluations agentiques, Sonnet 5.5 devance parfois son grand frère. « Claude Sonnet 5.5 reaches 64% against 60% for Opus 5.5 and GPT-6 Astra » sur Terminal-Bench, écrit Artificial Analysis. Le modèle atteint aussi la parité avec Opus 5.5 sur AA-Briefcase (1811 Elo contre 1822) et GDPval-AA (1844 contre 1846).
Le problème : la verbosité. « At max effort, where it reaches performance nearing that of Opus 5.5, Claude Sonnet 5.5 used ~193k Output Tokens per Intelligence Index Task », rapporte le benchmark, qualifiant ce chiffre de « the highest token use we have measured, around 60% higher than Opus 5.5 (max) ». Environ sept fois ce que consomme GPT-6 Astra en mode équivalent.
Le tarif catalogue ne bouge pas. « Anthropic has priced Sonnet 5.5 identically to Sonnet 5 at $0.2/$2/$10 per 1M cache input/input/output tokens ». Mais avec plus de tokens produits, la facture par tâche gonfle : le modèle « outputs a higher number of Output Tokens per Task and costs $7.60 per task (~50% higher than Sonnet 5's Cost per Task) ».
Une réserve inscrite noir sur blanc dans le rapport : sur AA-Omniscience, qui mesure la précision factuelle, Sonnet 5.5 marque 54% contre 66% pour Opus 5.5. Le rattrapage agentique ne s'est pas encore accompagné du même gain sur la connaissance générale. C'est notre deuxième couverture du modèle cette semaine, après l'annonce d'Anthropic du 28 septembre.
Shared on Bluesky by 1 AI expert
Article original publié par artificialanalysis.ai
Lire l'article original →Titre original : Artificial Analysis classe Claude Sonnet 5.5 deuxième derrière Opus 5.5, avec 60 % de tokens en plus