8月5日,清华系AI视频团队Sand.ai正式发布并开源了视频生成模型MAGI-2 Preview。这是全球首个千亿级开源MoE视频生成模型,总参数约114B(1140亿),采用MoE(混合专家)架构,单次前向计算仅激活约6B参数,激活比例约为5.26%。
这个“114B总参数、6B激活参数”的组合,是MAGI-2-preview最值得关注的地方。它意味着模型没有照搬稠密视频模型“参数越多、每一步计算越贵”的扩展方式,而是通过稀疏激活,把模型容量与单次计算量部分解耦。按照Sand.ai披露的估算,在8张NVIDIA H100上生成一段10秒、1080P视频,计算成本约为0.5元,平均每秒约0.05元,约为行业主流模型成本的十分之一。在Artificial Analysis的图生视频(Image to Video)榜单上,MAGI-2 Preview排名第六——一个激活参数仅6B的开源模型,生成效果已经进入当前视频生成的第一梯队。
MAGI-2 Preview是一款统一音视频生成模型。与分别生成画面和声音、再通过Cross-Attention或后处理进行连接的多流方案不同,该模型采用单流架构,将文本、视频和音频输入同一个Transformer,并在每层Self-Attention中持续交换信息,由同一模型共同完成画面和声音生成。这种设计让画面和声音从第一层开始就共同建模,更适合处理细微的音画对应关系;同时统一主干也让延迟和维护成本比模型串联低得多,也更天然适配MoE扩展。模型内部同时设置共享专家与模态专属专家,前者负责处理不同模态之间的共性信息,后者分别处理语言、画面及声音等模态的特有信息,以提升人物口型、动作、环境声音及画面变化之间的同步能力。
在模型架构方面,MAGI-2 Preview采用Sand.ai称为“Ultra-fine-grained MoE”的细粒度专家架构。模型将3072维隐藏表示拆分为12个256维Head,并在36层主体网络中采用Multi-Head MoE。每个Head拥有256个专家,每次选择其中6个,一个Token在12个Head中合计激活72个小专家,在扩大模型总容量的同时,将单次计算的激活参数量控制在约6B。针对MoE模型规模扩大后带来的跨设备通信问题,MAGI-2 Preview还引入Head Parallel机制:在动态专家路由之前,先将固定形状的Head表示分发至不同设备,再在本地进行专家选择和计算,以降低大量专家激活带来的跨设备通信压力。
围绕上述架构,Sand.ai还自主开发了MagiMoE和分布式优化器MagiMuon。MagiMoE覆盖专家路由、排序和计算链路,并针对大量小矩阵计算进行优化;MagiMuon则使用Muon处理主体矩阵参数,并使用AdamW处理更适合常规更新的参数。Sand.ai方面认为,视频模型Scaling不仅意味着增加参数规模,同时需要解决通信效率、计算效率、数值稳定性以及训练监控等系统问题。
MAGI-2 Preview支持文生视频(T2V)和图生视频(I2V),可以同时生成画面、对白、音乐和环境声,目前单次固定生成10秒。生成过程分为两个阶段:magi2_preview在低分辨率下降噪生成片段,magi2_refiner将结果提升至1080P。模型权重、推理代码以及技术报告《MAGI-2 Preview: Scaling Video Generation Models Efficiently》已全部开源,权重可在Hugging Face(sand-ai/MAGI-2-preview)下载,其中preview阶段Transformer约228GB、文本编码器(Qwen3.5-27B)约56GB、refiner约14GB。
这是Sand.ai继MAGI-1之后又一次把主力视频生成模型带入开源体系。2025年4月,Sand.ai曾开源24B参数的自回归视频模型MAGI-1;时隔一年多,参数规模从240亿扩大至1140亿,并首次将千亿参数、MoE和开放权重三件事捏在一起。Sand.ai创始人曹越是清华大学特等奖学金获得者、Swin Transformer共同一作,曾联合创办光年之外,也曾在智源研究院负责多模态与视觉研究。创新工场董事长李开复曾公开推荐该团队,称其为“AI视频生成界的DeepSeek”。
过去两年,开源视频生成模型的参数规模大多停留在十几B以内,最大的也不过二三十B。视频的序列远比文本长,分辨率、帧率和生成时长中的任何一项增加,都会进一步推高token数量;在稠密模型中,参数增加会让单个token的计算量同步上升,再乘上视频的超长序列,训练和推理成本很快变得难以承受。2026年3月OpenAI停止运营Sora,很大一部分原因就在于当时的架构和推理成本不具备大规模商用经济性。MAGI-2 Preview将总参数推至114B,尝试解决的正是这个问题——千亿级MoE,不只属于语言模型。
此次MAGI-2 Preview开源,也意味着千亿级视频MoE模型路线进一步进入开源社区。研究者可以验证这种细粒度MoE是否真的更适合视频生成;开发者可以围绕模型继续进行微调、量化以及工作流开发;推理框架团队可以继续优化专家路由、显存占用和通信效率;企业也能够根据自己的数据环境进行私有化部署。Sand.ai表示,下一步将继续扩大模型与数据规模,探索更长时长的视频生成,并进一步提升生成质量、音画同步和长时一致性,同时持续降低单位视频生成成本。