SLAI T-Rex : post-training full-parameter de DeepSeek-V4 sur Ascend SuperPOD, MFU 34,22 % (×2,93 vs baseline)
Résumé
SLAI-AITP publie SLAI T-Rex, un framework hiérarchique qui pousse la famille DeepSeek-V4 (MoE trillion) en post-training complet sur le SuperPOD Ascend de Huawei, atteignant 34,22 % de MFU soit 2,93× la baseline open-source. Le modèle spécialisé Operations Research franchit 71,81 % de zero-shot Pass@1, +3,98 pts sur GPT-5.4-Mini. Une nouvelle démonstration que DeepSeek s'entraîne à pleine échelle sans GPU Nvidia.
Article original publié par huggingface.co
Lire l'article original →Titre original : SLAI T-Rex : post-training full-parameter de DeepSeek-V4 sur Ascend SuperPOD, MFU 34,22 % (×2,93 vs baseline)