Motif Technologies publie Motif 3 Beta, MoE 314B avec 13B actifs et 256K de contexte
Résumé
Motif Technologies (Corée) publie le rapport technique de Motif 3, un modèle MoE décodeur de 314 milliards de paramètres avec 13,2 Md actifs par token sur 53 couches et 384 experts. Le modèle introduit Grouped Differential Latent Attention, une activation PolyNorm par expert et un contexte natif de 256K tokens, entraîné sur 12,5 T tokens en MXFP8 sélectif. Les poids sont téléchargeables sur Hugging Face sous licence non commerciale, avec 86,2 % MMLU et 73,7 % HumanEval au pré-entraînement.
Article original publié par huggingface.co
Lire l'article original →Titre original : Motif Technologies publie Motif 3 Beta, MoE 314B avec 13B actifs et 256K de contexte