huggingface.co détecté sur le web

AuK: modèle audio open source unifie génération, édition, séparation et enhancement en 1,95 M heures d'entraînement

Résumé

L'équipe menée par Xie Chen publie AuK, modèle fondation audio open source qui unifie TTS zero-shot, édition acoustique, édition paralinguistique, séparation et enhancement via une interface d'instructions en langage naturel. Entraîné sur ~3,03 milliards d'instances instruction-audio (1,95 M heures) autour de Qwen2.5-Omni et d'un DiT rectified-flow, il atteint 2,65 % de WER et 0,795 de SIM sur Seed-TTS-Eval, devant Qwen3-TTS. La variante AuK-Flash distillée offre 4,5× d'accélération wall-clock avec des scores UTMOS supérieurs, code et poids publiés.