WanSong v1.0 : Alibaba publie un modèle de génération musicale 25B en pure diffusion avec stems vocal et instrumental séparés
Summary
Alibaba publie le 16 juillet le rapport technique de WanSong v1.0, un modèle de 25B paramètres en diffusion pure qui génère jusqu'à 5 minutes de chanson multilingue en une seule passe, avec sortie séparée voix et musique de fond. Sur son propre benchmark, WanSong atteint 7,43 % de Pronunciation Error Rate contre 12,7 % pour Mureka V7.6 et 22,8 % pour Suno V5, et note 5,49/10 en musicalité (contre 4,18 pour Suno). Le modèle a été entraîné sur plus de 6 millions d'heures de données audio.
Originally reported by huggingface.co
Read the original article →Original headline: WanSong v1.0 : Alibaba publie un modèle de génération musicale 25B en pure diffusion avec stems vocal et instrumental séparés