Google: Gemini 4 Argon égale GPT-6 Astra à 60% du prix par tâche
TL;DR
- Gemini 4 Argon marque 53 sur l'Intelligence Index d'Artificial Analysis en mode « high », à égalité avec GPT-6 Astra (max) et un point devant GPT-6.1 Sol.
- Google tarife en lancement 2 $ par million de tokens d'entrée et 10 $ en sortie, soit 1,99 $ la tâche d'index contre 3,26 $ pour GPT-6 Astra.
- Bloomberg rapporte que des salariés jugent Argon fort sur benchmarks mais faible sur le code réel ; Google invoque un « large consensus » interne qu'il est « at the frontier ».
Google a lancé le 30 septembre Gemini 4 Argon, tarifé en introduction à 2 $ par million de tokens d'entrée et 10 $ en sortie, contre 4 $ et 20 $ au tarif standard, avec un million de tokens de contexte et une sortie étendue au million de tokens (contre 64 K auparavant).
Sur l'Intelligence Index d'Artificial Analysis, Argon en mode « high » marque 53, à égalité avec GPT-6 Astra (max) et un point devant GPT-6.1 Sol (max, 52). Le laboratoire relève un taux d'hallucination de 15 % sur AA-Omniscience, « the lowest of any model scoring 45+ on the Intelligence Index », contre 51 % pour GPT-6 Astra et 54 % pour GPT-6.1 Sol. Au prix remisé, une tâche d'index revient à 1,99 $, soit 60 % des 3,26 $ de GPT-6 Astra. « Google is now back to being one of the top three labs in intelligence achieved », écrit Artificial Analysis.
Dans le billet signé par Koray Kavukcuoglu, SVP de Google DeepMind et Chief AI Architect, Google met en avant 77,9 % sur DeepSWE v1.1, 68 % (ex aequo) sur CWE-bench v1 pour la correction de vulnérabilités, 91,7 % sur LVBench pour la vidéo longue et le premier rang sur AutomationBench à 51,3 %. Le modèle est d'abord déployé via le programme Fairwind auprès de défenseurs cyber, avant une diffusion plus large.
La lecture interne est moins unanime. Bloomberg rapporte que des salariés de Google jugent qu'Argon « looks strong on benchmarks but falls short on certain real-world coding tasks », avec une faiblesse spécifique sur le design front-end. L'entreprise rétorque qu'il serait « inaccurate to say that Gemini 4 is underperforming in areas such as coding », et un employé proche du développement cité par Bloomberg affirme qu'il existe un « large consensus » interne pour dire que « Gemini 4 is at the frontier ». Sur Terminal-Bench 4.0, Claude Opus 5.5 reste pourtant devant à 66,4 % contre 57,4 % pour Argon, alors qu'Argon devance Opus 5.5 sur le Vals Index (68,9 % contre 67,0 %).
C'est la deuxième lecture serrée d'Artificial Analysis que nous suivons cette semaine : lundi, Claude Sonnet 5.5 se classait à deux points d'Opus 5.5 sur le même index.
Shared on Bluesky by 5 AI experts
-
Google is back!
View on Bluesky →
Article original publié par blog.google
Lire l'article original →Titre original : Google lance Gemini 4 Argon à 53 d'Intelligence Index, à parité avec GPT-6 Astra et au tiers de son prix