SenseNova-U1.5 unifie compréhension et génération 4K sur un MoT 8 B avec RL multi-expert
Résumé
SenseTime publie SenseNova-U1.5, un Mixture-of-Transformers natif de 8,2 B paramètres qui unifie compréhension visuelle, raisonnement et génération d'images jusqu'à 4096×4096 dans une architecture sans encoder ni VAE. Le modèle affiche 73,86 sur MMMU, 0,92 sur GenEval et 4,59 sur ImgEdit — meilleur open source sur plusieurs benchmarks — grâce à un entraînement en cinq étapes incluant RL multi-expert (aesthetic, OCR, editing, infographic).
Article original publié par huggingface.co
Lire l'article original →Titre original : SenseNova-U1.5 unifie compréhension et génération 4K sur un MoT 8 B avec RL multi-expert