Fortune : OpenAI a discrètement rehaussé plusieurs métriques d'évaluation de GPT-6 Astra après son lancement
Résumé
Fortune documente que OpenAI a modifié plusieurs benchmarks de GPT-6 Astra entre les versions archivées de son blog d'annonce. Le taux d'hallucinations est passé de 4,2 % à 2 %, puis est revenu à 4,2 %, tandis que des scores mathématiques attribués à Anthropic ont fluctué. OpenAI parle de vérifications normales avant publication, les chercheurs y voient du 'benchmaxxing' qui complique la comparaison entre modèles.
Article original publié par fortune.com
Lire l'article original →Titre original : Fortune : OpenAI a discrètement rehaussé plusieurs métriques d'évaluation de GPT-6 Astra après son lancement