'Last Translation Benchmark' publie 3 456 exemples multimodaux avec règles de vérification pour saturer les modèles de traduction
Résumé
Le Last Translation Benchmark publie 3 456 exemples multimodaux (textes, images, audio, vidéos) peer-reviewed avec règles de vérification handcraftées pour chaque exemple, contournant les métriques automatiques et le reward-hacking. Verdict des auteurs : la traduction machine ne bute plus tant sur le figuré que sur le raisonnement multilingue et culturel — prochain palier à investir.
Article original publié par huggingface.co
Lire l'article original →Titre original : 'Last Translation Benchmark' publie 3 456 exemples multimodaux avec règles de vérification pour saturer les modèles de traduction