8月5日消息,Sand.ai近日正式发布并开源视频生成模型MAGI-2 Preview。据介绍,该模型总参数约114B,采用MoE架构,单次前向计算仅激活约6B参数,是全球首个千亿级开源MoE视频生成模型。目前,MAGI-2 Preview在Artificial Analysis Image to Video视频生成榜单中排名第六。

成本方面,按照当前8卡H100月租金折算,蒸馏后的MAGI-2 Preview生成10秒1080P视频,推理成本约0.5元,平均每秒约0.05元。据Sand.ai披露,其每秒生成成本约为行业主流模型的十分之一。

MAGI-2 Preview是一款统一音视频生成模型。与分别生成画面和声音、再通过Cross-Attention或后处理进行连接的多流方案不同,该模型采用单流架构,将文本、视频和音频输入同一个Transformer,并在每层Self-Attention中持续交换信息,由同一模型共同完成画面和声音生成。

这一架构延续了Sand.ai此前在daVinci-MagiHuman论文中提出的技术路线。模型内部同时设置共享专家与模态专属专家,前者负责处理不同模态之间的共性信息,后者分别处理语言、画面及声音等模态的特有信息,以提升人物口型、动作、环境声音及画面变化之间的同步能力。

在模型架构方面,MAGI-2 Preview采用Sand.ai称为“Ultra-fine-grained MoE”的细粒度专家架构。模型将3072维隐藏表示拆分为12个256维Head,并在36层主体网络中采用Multi-Head MoE。每个Head拥有256个专家,每次选择其中6个,一个Token在12个Head中合计激活72个小专家,在扩大模型总容量的同时,将单次计算的激活参数量控制在约6B。

针对MoE模型规模扩大后带来的跨设备通信问题,MAGI-2 Preview还引入Head Parallel机制,在动态专家路由之前,先将固定形状的Head表示分发至不同设备,再在本地进行专家选择和计算,以降低大量专家激活带来的跨设备通信压力。

围绕上述架构,Sand.ai还自主开发了MagiMoE和分布式优化器MagiMuon。其中,MagiMoE覆盖专家路由、排序和计算链路,并针对大量小矩阵计算进行优化;MagiMuon则使用Muon处理主体矩阵参数,并使用AdamW处理更适合常规更新的参数。

Sand.ai方面认为,视频模型Scaling不仅意味着增加参数规模,同时需要解决通信效率、计算效率、数值稳定性以及训练监控等系统问题。此次MAGI-2 Preview开源,也意味着千亿级视频MoE模型路线进一步进入开源社区。

Sand.ai表示,下一步将继续扩大模型与数据规模,探索更长时长的视频生成,并进一步提升生成质量、音画同步和长时一致性,同时持续降低单位视频生成成本。(定西)