huggingface.co détecté sur le web

SenseNova-U1.5 unifie compréhension et génération 4K sur un MoT 8 B avec RL multi-expert

Résumé

SenseTime publie SenseNova-U1.5, un Mixture-of-Transformers natif de 8,2 B paramètres qui unifie compréhension visuelle, raisonnement et génération d'images jusqu'à 4096×4096 dans une architecture sans encoder ni VAE. Le modèle affiche 73,86 sur MMMU, 0,92 sur GenEval et 4,59 sur ImgEdit — meilleur open source sur plusieurs benchmarks — grâce à un entraînement en cinq étapes incluant RL multi-expert (aesthetic, OCR, editing, infographic).