LynnReal-Omni: transformer diffusion multimodal 32 B, 22 frames 540p en 377 ms sur un H100
Résumé
LynnReal-Omni unifie text-to-video, génération conditionnée par image, contrôle structurel, édition, restauration et vidéo longue dans un seul diffusion transformer multimodal de 32 B paramètres. Le modèle accepte références d'apparence, rendus 3D éditables et enregistrements de jeux comme entrées visuelles hétérogènes. La variante Flash génère une vidéo 22 frames 540p en 377 ms sur un unique H100, ouvrant la voie au streaming temps réel des workflows agentiques.
Article original publié par huggingface.co
Lire l'article original →Titre original : LynnReal-Omni: transformer diffusion multimodal 32 B, 22 frames 540p en 377 ms sur un H100