智东西(公众号:zhidxcom)
作者 | 王涵
编辑 | 漠影
8月的第一周,国内视频生成赛道格外热闹。
7月31日,MiniMax发布首款开源多模态生成模型H3;同一天,字节跳动推出Seedance 2.5,将单次生成时长从15秒拉长至30秒。
根据国际咨询公司Grand View Research估算,全球AI视频市场规模预计将从2025年的45.5亿美元迅速增长至2030年的422.9亿美元,复合年均增长率(CAGR)达32.2%,显示出极高的成长潜力。
新模型的轮番轰炸、千亿级市场的想象空间,AI视频生成赛道迎来了前所未有的高光时刻。
就在这个窗口期,北京AI视频生成创企Sand.ai悄然扔下了一枚深水炸弹——全球首个千亿级MoE视频生成模型MAGI-2 Preview正式发布并开源。
该模型总参数约114B,单次前向激活约6B参数。在最关心更新的Artificial Analysis的Image to Video榜单上,MAGI-2 Preview进入全球前十,排在第六位。

优秀的榜单成绩和酷炫的使用案例是最容易呈现给市场的东西,但这个模型最大的价值,是其验证出了大规模MoE视频模型扩展的一条明路:统一单流负责音画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳定运转。
而其中的奥妙,就藏在模型层、架构层和系统层的三层系统里。
一、视频生成赛道火热,技术却撞上两堵墙
2026年前5个月,国内AI短剧市场规模突破220亿元,全年有望冲击400亿元,用户超过6亿。视频生成赛道正在经历从“能不能做”到“能不能做好、做便宜”的关键转折。
需求端的爆发式增长,正在将基础模型的承载能力逼至极限,但视频生成模型的进化撞上了”两堵墙“。
一堵是容量。模型要处理的人物、动作、镜头和场景越来越复杂,还要把对白、环境声和音乐放进同一次生成,需要容纳的信息快速增加。
以最直观的Token数为例,大语言模型中,一段1000字的英文短文大约对应1000多个token,中文的token消耗还要略高。
但视频完全是另一个量级。一张720P的图片在视觉编码器下会被切分成近千个patch tokens,而一秒视频包含24帧。
模型在处理一段几秒钟的视频时,需要同时面对几十万甚至上百万个视觉token,再叠加音频波形和文本指令,序列长度轻松达到纯文本任务的数百倍。
另一堵是成本。面对如此庞大的token规模,也意味着每一次前向计算都要处理远超文本的数据量。并且,模型规模越大,训练所需的算力、跨机器通信量和推理费用通常越高。
继续放大稠密模型,单次生成调用的参数量也会同步增长。机器可能先被拖慢,效果却未必按比例提升。
面对同样的容量和成本问题,大语言模型已经用MoE探索出一条Scaling路径,这一方式是否能迁移到视频模型上呢?
早在2025年11月,Sand.ai就做了一个在当时看来“非共识”的决定——将模型架构从Dense转向MoE,8个月后,MAGI-2 Preview给出了答案。
MAGI-2 Preview 是一款统一音视频生成模型,即由一个模型共同生成画面与声音。该模型采用Multi-Head MoE架构,文本、视频和音频进入同一个Transformer,在每一层self-attention中持续交换信息,口型、表情、动作、对白、环境声和镜头节奏从生成开始便相互影响。
二、模型层:统一单流,音画同出
现有统一音视频模型常见两种路径,一类采用多流架构,让视频和音频进入不同的网络分支,再通过cross-attention或专用融合模块交换信息;另一类采用级联方案,分别生成画面和声音,再完成同步处理。
多流模型可以端到端联合训练,但独立分支、融合模块和模态专属计算路径会增加架构复杂度,产生更不规则的计算与通信。级联方案还要维护额外的接口与同步模块,音画关系需要经过多段链路才能建立。
在模型层,MAGI-2 Preview采用的是单流架构,即文本、视频和音频被放进同一个上下文,在每一层self-attention中直接交互。
也就是说,MAGI-2 Preview让声音、口型、表情、动作和镜头节奏从生成开始便被共同建模,更适合处理细微的音画对应关系。
统一主干还减少了多套模型串联带来的接口、延迟与维护成本。模型内部设有共享专家处理三种模态的共性特征(如场景语义、运动趋势),同时为文本、视频和音频保留了各自的专属专家,用不同分工处理三种模态的共性与差异。
文本、视频和音频在同一条生成链路中联合处理,无需维护彼此独立的生成主干和额外的跨模态融合模块。架构更简单,端到端延迟远低于多流串联方案。
三、架构层:把专家粒度做到极致
将MoE直接应用于视频场景,并非没有代价。
传统Expert Parallel先为token选出Top-K专家,再将token复制分发到专家所在设备,通信量随激活专家数线性增长,负载不均进一步加剧调度开销,序列长度达到视频量级时,稀疏计算带来的收益很容易被侵蚀殆尽。
更深层的问题在于路由对象本身。传统MoE为一个token的完整表示选择一组专家,相当于要求少数专家同时理解语义、动作、外观、声音等所有维度的特征,限制了模型对不同信息类型的分化处理能力。
这两个问题驱动Sand.ai重新思考MoE在视频模型中的实现方式,先前Multi-Head LatentMoE and Head Parallel这项工作给出了解决路径。
在通信层面,Head Parallel将跨设备通信前置到路由之前,按head分发数据,设备间传输的是形状固定的head表示,而非动态变化的专家token,主要通信量只取决于输入表示本身。

在路由层面,Multi-Head MoE改变了选择对象。它将同一个token的3072维隐藏表示拆成12个256维的子空间,每个子空间独立路由、各自选择专家。

MAGI-2 Preview正是沿这条思路,在36层主体网络中使用Multi-Head MoE,并围绕统一音视频扩散补齐了共享与模态专属专家、路由策略、跨节点Head Parallel、融合计算内核、混合精度和激活重计算,并将其推进为千亿参数统一音视频模型的可训练系统。
四、系统层:让几千个专家别堵在路上
Multi-Head MoE与Head Parallel解决了路由粒度和通信效率的问题,但从架构设计到大规模稳定训练之间仍有距离。
数千个细粒度专家在训练中产生的频繁路由决策、数据重排和显存搬运,对底层算子的执行效率提出了苛刻要求;海量专家的参数更新,也对优化器的稳定性构成了新的挑战。
为解决这一难题,Sand.ai在底层算子计算和训练稳定性两个层面自研了一套infra。
算子层面,Sand.ai开发了高性能MoE kernel库MagiMoE,覆盖路由、专家排序与专家计算的完整链路,将原本分散的步骤合并执行,减少中间结果与显存搬运,并针对Multi-Head MoE的计算形态优化前向与反向过程。MAGI-2 Preview当前采用其中经过大规模训练验证的Triton/BF16路径。
训练优化层面,MAGI-2 Preview采用分布式优化器MagiMuon,以Muon处理主体矩阵参数,以AdamW处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织与跨设备计算。这种混合设计让优化方法能够从中小规模实验稳定扩展至千亿参数MoE。
五、数据:预训练要看到真实世界,后训练才谈对齐
Scaling定律有一个经常被忽略的前提:参数量增大,数据的信息密度也需要同步提高。
但提高信息密度不等于缩小数据集,过度清洗会让模型失去对复杂运动、特殊镜头、罕见主体和非典型声音的覆盖能力,最终参数规模的增长可能无法转化为真实场景中的生成能力。
因此,Sand.ai更强调数据的规模、多样性与分布覆盖。数据工作的重点从删减转向组织——通过更准确、细粒度的标注,让模型理解主体、动作、场景、镜头、时序以及音频与文本之间的对应关系。
保留更广泛的有效数据,比追求一个狭窄的“完美数据集”更符合Scaling阶段的需求。
相应地,预训练与后训练的分工也被重新定义。预训练负责尽可能完整地覆盖数据分布,后训练聚焦于偏好对齐、可控性与产品适配。
基础模型在预训练阶段学到的能力越完整,产品端依赖后处理去修补运动一致性、细节表现和组合能力的需求就越少。
结论:视频生成的Scaling Law,从此有了新写法
Sand.ai对Scaling的认知是:规模本身并不等于能力。模型参数的增长只是起点,真正的挑战在于——更大的专家池能否被足够丰富的真实数据所填充,更细粒度的路由结构能否被精确的标注所引导,更密集的计算需求能否被稳定高效的底层系统所支撑。
三者同时推进,参数规模的增长才具备实质性意义。
从这个思路出发,MAGI-2 Preview验证了一整条路线:统一单流负责音画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳定运转。Artificial Analysis的Image to Video榜单第六名就是这一路线最好的证明。
更可喜的是,MAGI-2 Preview全面开源,后续模型可以沿着这条路线继续扩大参数与数据规模,探索更长的生成时长,无需每次从头搭建训练系统。
视频生成的Scaling Law,从此有了新写法。