fortune.com détecté sur le web

Fortune : OpenAI a discrètement rehaussé plusieurs métriques d'évaluation de GPT-6 Astra après son lancement


<span>Fortune : OpenAI a discrètement rehaussé plusieurs métriques d'évaluation de GPT-6 Astra après son lancement</span>
OpenAI Sam Altman ai-business

Résumé

Fortune documente que OpenAI a modifié plusieurs benchmarks de GPT-6 Astra entre les versions archivées de son blog d'annonce. Le taux d'hallucinations est passé de 4,2 % à 2 %, puis est revenu à 4,2 %, tandis que des scores mathématiques attribués à Anthropic ont fluctué. OpenAI parle de vérifications normales avant publication, les chercheurs y voient du 'benchmaxxing' qui complique la comparaison entre modèles.