
这项由清华大学、中国人民大学、香港科技大学及德克萨斯大学奥斯汀分校联合完成的研究,以论文编号arXiv:2605.30263v1于2026年5月28日公开发布,背后的产业支持来自生数科技(ShengShu)团队。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。
一、一个让AI"导演"能实时控制镜头的梦想
当你打开一款游戏,随手拨动摇杆,镜头便跟着向左推移,眼前的虚拟世界随之流畅展开——这种体验之所以让人沉浸其中,核心在于两件事:镜头听你的话,而且画面几乎不卡。现在,如果把这个"虚拟世界"换成一个由AI实时生成的视频场景,你就能理解这篇论文想解决的核心问题了。
过去几年,AI视频生成技术飞速进步,各类模型已经能够生成画质精美、时间连贯的视频片段。但这些模型有一个致命短板:它们像一位只会拍长片的导演,每次都要把整段视频从头到尾生成完毕才交给你看,根本无法边拍边给你看,更别说根据你实时的操控指令来调整镜头了。换句话说,它们很擅长"创作",却不擅长"互动"。
于是,一个自然而然的问题出现了:能不能把这些高质量的AI视频生成模型,改造成真正能实时互动、实时响应镜头控制的"视频世界模型"?这正是minWM这个开源框架想要回答的问题。
二、从"画卷"到"实时直播"——改造一个AI导演有多难
在理解minWM的解决方案之前,有必要先搞清楚现有AI视频模型的工作方式,以及改造它们面临的真正挑战。
现有的主流AI视频生成模型,在技术上被称为"双向扩散模型"。用一个直观的比喻来理解:这类模型就像一位需要整体构思后才动笔的画家,他会在脑海中把整幅画的每一处细节都想清楚,然后一次性落笔完成。正因为它在生成时可以"前后参照"整段视频的所有帧,所以画质非常高。但代价是,它必须等整幅画都完成了才能给你看——在一台A800显卡上,生成一段视频的首帧延迟高达771秒,差不多13分钟。这对于需要实时互动的场景来说,完全不可接受。
要实现实时互动,模型必须转变为"自回归"方式工作——也就是像说话一样,一帧接一帧地向前生成,生成完一帧立刻输出,不需要等整段视频完成。这样用户就能边看边操控。但这个转变并不简单,因为一旦模型失去了"前后参照整段视频"的能力,生成质量往往会大幅下降,还会产生所谓的"暴露偏差"问题——模型在训练时看到的是真实视频帧,但在实际推理时却要依赖自己刚刚生成的帧作为输入,两者之间的差异会随着时间累积,导致视频越往后质量越差,甚至出现画面漂移。
不仅如此,哪怕模型变成了自回归方式,如果每次生成一帧还需要做几十步的去噪运算,延迟依然令人发指。因此,还需要进一步把模型"提速"到只需要极少步骤(比如4步)就能生成一帧的程度,这个过程被称为"少步蒸馏"。
把以上所有挑战放在一起:你需要的数据要有精准的相机参数标注,你需要对模型进行可控性微调,你需要做自回归训练,你需要做少步蒸馏,你还需要优化推理效率。这整条流水线,之前从来没有一个统一、开源、可复现的框架把它们串在一起。这正是minWM填补的空白。
三、一条完整的"改造流水线"——minWM的工作原理
minWM的设计思路,可以类比成一家汽车改装厂的完整工序。原始的双向视频扩散模型就像一辆性能出色但只适合赛道的赛车,外观漂亮、马力强劲,但完全不适合日常道路上的实时驾驶互动。改装厂(也就是minWM)要把它变成一辆既好看、又能实时响应方向盘操控、还能高速行驶的智能汽车。
整个改造流程分为两大阶段,第一阶段是给模型装上"镜头控制系统",第二阶段是把模型的工作方式从"慢速全局计算"改为"快速实时生成"。
第一阶段的核心技术叫做PRoPE(射影相对位置编码)。相机控制的本质,是告诉模型"摄影机在哪里、朝哪里看、镜头焦距是多少",并让模型据此生成符合该视角的画面。PRoPE的做法是把每一帧的相机参数——包括内参矩阵(决定镜头焦距和畸变)和外参矩阵(决定相机的空间位置和朝向)——编码成一种特殊的数学变换矩阵,然后把这个矩阵注入到模型的自注意力机制中。自注意力机制可以理解为模型在处理视频帧时"思考各帧之间关系"的核心模块。通过这种注入方式,模型在"思考"任意两帧之间的关系时,会自动考虑到这两帧对应的相机视角差异,从而学会根据相机轨迹来生成视频。这种方式的优雅之处在于,它不需要改变模型原有的注意力结构,只是在计算注意力时引入了相机信息,保留了原始模型的生成能力。
第二阶段的流程由三个步骤串联而成,研究团队将其称为"因果强制(Causal Forcing)"或"因果强制++(Causal Forcing++)"。
第一步是自回归扩散训练。从上一阶段得到的具有相机控制能力的双向模型出发,通过一种叫做"teacher forcing"的训练方式,把它改造成一个自回归扩散模型。具体做法是把干净的视频帧和加了噪声的视频帧拼接在一起,并在训练时使用因果注意力掩码——也就是让模型在生成第N帧时只能看到第N帧之前的内容,不能偷看未来的帧。经过这一步,模型就具备了自回归生成能力,能够一帧接一帧地向前生成视频。但此时每帧还需要多步去噪,速度依然不够快,而且由于自回归的暴露偏差,质量也弱于双向模型。
第二步是初始化少步模型。这里有两种方案可选。方案一叫做"因果ODE初始化":让上一步训练好的自回归扩散模型,对大量视频帧生成完整的去噪轨迹(即PF-ODE轨迹),然后在这些轨迹数据上训练一个少步模型,使其能够从加噪的中间帧直接"跳跃"到干净帧,跳过大量中间去噪步骤。方案二叫做"因果一致性蒸馏(Causal CD)":由于方案一需要大量预先生成ODE数据,既耗时又占存储,因果强制++提出了理论上等价的替代方案——直接通过一致性条件进行在线训练,无需离线生成ODE轨迹。具体来说,就是让当前模型的预测结果与经过一步ODE推进后再用EMA(指数移动平均)版本模型预测的结果保持一致,同时配合时间步相关的权重函数和距离度量来约束训练。两种方案的最终效果是等价的,但后者在工程上更高效。
第三步是非对称分布匹配蒸馏(Asymmetric DMD)。经过前两步,模型已经能够少步自回归生成,但由于整个蒸馏过程的"老师"是质量有限的自回归模型,学生自然也继承了老师的局限性,生成质量距离原始双向模型仍有差距。这一步的作用,就是让少步自回归模型向原始高质量双向模型"对齐"。具体机制是:让少步学生模型自主展开生成一段完整视频,然后把生成的视频加入噪声,分别用一个冻结的双向模型(代表"真实数据分布的评分")和一个在线更新的判别模型(代表"当前生成分布的评分")来估算两个分布之间的差异,并以此梯度指导学生模型的参数更新。这个过程就像让学徒不断临摹大师的风格,而不是只靠中等老师的指导——最终学徒的作品质量会向大师靠拢。
值得一提的是,整个蒸馏流程对相机控制是完全透明的。无论是第一步的自回归训练,还是第二步的ODE数据生成或一致性蒸馏,还是第三步的分布对齐,所有阶段都在带有相机条件的数据上进行,所有参与的模型都具备相机条件能力,确保相机控制能力在整个蒸馏过程中得以保留而不流失。
四、两个实例——把理论变成真实可用的模型
研究团队选择了两个代表性的开源视频基础模型作为改造对象,分别是Wan2.1-T2V-1.3B(文本到视频,13亿参数)和HY1.5-TI2V-8B(文本加图像到视频,80亿参数)。选择这两个模型有其深意:前者采用交叉注意力机制来注入条件信息,后者采用MMDiT架构(一种将文本和图像特征在同一Transformer中联合处理的结构),两种架构代表了当前主流视频扩散模型的两大设计路线,证明了minWM框架的架构通用性。
在训练设置上,两个模型都被训练生成分辨率为480×832像素、共77帧的视频,自回归的"块大小"为4个潜在帧(潜在帧是视频在编码器压缩后的表示,比原始像素帧更紧凑)。少步蒸馏统一使用4步推理。HY1.5系列的训练使用批大小32、学习率1×10??,双向模型训练8000步,随后依次进行4000步、1500步、500步的三阶段蒸馏。Wan2.1系列使用批大小32、学习率2×10??,双向模型训练5000步,随后进行4000步、2000步、200步的三阶段蒸馏。
改造完成后的性能提升令人印象深刻。在单张A800显卡上测量首帧延迟(即从开始运行到生成出第一帧画面所需的时间,不含VAE解码时间),原始HY1.5双向模型需要771秒,改造成多步自回归模型后降至81秒,最终的少步自回归模型仅需3.446秒,相较于原始双向模型实现了223.75倍的加速。Wan2.1的情况同样出色:原始双向模型需要269秒,多步自回归版本降至28.6秒,最终少步自回归版本仅需1.137秒,实现了236.64倍的加速。
这里有一点值得理解清楚:双向模型之所以首帧延迟那么高,是因为它必须先生成整段视频才能给你第一帧。而自回归模型则是生成完第一帧就立刻输出,后续帧在你观看第一帧的同时继续生成。因此在实际应用中,自回归模型的用户体验改善远不止数字所呈现的倍数,它让"边生成边观看"成为可能。
五、数据是成败的关键——三种路线的对比实验
模型能否学会根据相机指令生成正确视角的画面,数据质量起着决定性作用。研究团队在训练数据的选择上做了大量实验,总结出了三条路线,每条路线的结果都大相径庭。
第一条路线是使用SpatialVid数据集。这个数据集包含大量带有相机参数标注的视频,但这些相机参数是通过计算机视觉算法从视频中"感知估算"出来的,并非真实测量值。实验结果令团队失望:无论是HY1.5还是Wan2.1,在这份数据上训练出来的模型都无法可靠地执行相机控制指令,即便进行了额外的数据过滤,问题依然存在。研究团队推测,感知估算出来的相机姿态本身含有噪声,且可能存在轨迹不一致的问题,这使得模型难以从中学到清晰的相机-画面对应关系。需要特别说明的是,这个结论针对的是他们当前的训练设置,并不代表SpatialVid数据集本身没有价值,更精细的过滤和姿态优化可能会改善这一问题,研究团队也把这一方向留作了未来工作。
第二条路线是从DL3DV数据集出发,通过三维重建和重新渲染来获得视频数据。DL3DV是一个大规模的真实场景数据集,研究团队先用三维重建技术从中重建出三维场景,然后沿着预设的相机轨迹渲染视频。这条路线的优势在于,渲染出来的视频和对应的相机参数是完全精确对应的"地面真值",没有任何估算误差。实验证明,在这份数据上训练的模型能够成功学会相机可控生成,达到了很好的效果。
第三条路线是为开源版本专门设计的方案:从OpenVid等图像数据集中采样图像,然后利用WorldPlay(一个已有的视频世界模型)根据指定的相机轨迹生成视频。由于WorldPlay本身就是一个具有几何一致性的视频生成系统,它输出的视频也具有可信赖的地面真值相机轨迹。实验表明,这条路线同样能让模型学会相机可控生成,且更适合开源场景,因为不需要复杂的三维重建流程。
六、训练步数与批大小——两个影响成功的关键细节
除了数据质量,研究团队还做了两组非常实用的消融实验,给出了训练步数和最小批大小的具体建议,这对于想要复现或迁移这项工作的研究者来说具有直接的参考价值。
关于训练步数,以HY1.5为例,研究团队观察到相机可控性是逐步涌现的。在仅训练一两千步时,模型几乎完全不响应相机控制指令,生成的画面与相机轨迹毫无关联。到五千步左右,模型开始能够响应相机信号,但表现仍然不稳定,时好时坏。当训练推进到八千步时,模型达到了强可控性,能够可靠、稳定地根据相机轨迹生成正确视角的视频。这说明,相机可控性的学习并非一蹴而就,需要足够多的训练轮次让模型真正内化这一能力。
关于批大小,以Wan2.1为例,研究团队发现这是一个不能随意缩减的超参数。当批大小小于4时,模型很难学会相机可控性,几乎必然失败。当批大小提升到8时,可控性有了大幅改善,但仍然不够稳定。只有当批大小达到16时,完整的训练流程才能顺利完成,并获得高质量的相机可控性。这对于计算资源有限的研究者而言是一个实用的下限指标:至少需要16的批大小才能保证成功。
七、不只是一个新模型,而是一套可复用的工具箱
minWM的定位与一般论文有所不同。大多数视频生成论文以展示单一最优模型的生成结果为核心,而minWM的目标是提供一套可复用、可扩展的完整工具链。这体现在几个具体方面。
研究团队发布了每个训练阶段的中间检查点,而不只是最终模型。这意味着其他研究者可以从任意一个中间阶段接力,无需重新从头训练整条流水线,大大降低了计算成本。同时,推理代码、训练脚本和使用文档也一同开源,确保论文中的结果可以被独立复现。
框架还支持对已有视频世界模型进行适配,而不仅仅是从零开始转换。以HY-WorldPlay为例,minWM支持把这类现成的视频世界模型迁移到新的数据分布、调整训练配方,或者进一步压缩到更低的推理延迟目标。这意味着,即使某个研究团队已经训练好了一个视频世界模型,也可以借助minWM的蒸馏流程把它改造得更快、更灵活,而无需重复上游的大量工作。
在推理端,minWM也做了相应的工程优化,包括针对流式场景的DiT去噪和VAE解码的流水线设计。VAE(变分自编码器)是把潜在空间的视频表示解码为可见像素画面的模块,在流式推理中需要与扩散去噪步骤并行或交织进行,才能实现视频边生成边播放的效果。
归根结底,这项研究最大的贡献不是某一个更强的视频模型,而是把过去散落在各处的技术拼图——数据构建、相机控制、自回归训练、少步蒸馏、流式推理——第一次系统地组装成一条完整且开源的生产线,让更多研究者可以站在这条生产线的基础上继续往前走,而不是每次都从零开始重建。
当然,这项工作也有明确的局限性和未尽之处。目前支持的控制条件只有相机运动,未来团队计划引入更多控制维度,比如人体姿态控制。同时,基于感知估算相机姿态的数据(如SpatialVid)在当前设置下效果欠佳这一问题,也留待后续研究通过更精细的数据处理来解决。这些开放问题本身也构成了这篇论文给社区留下的研究空间。
由此可见,对于那些希望探索交互式视频生成、视频世界模型或应用的研究者来说,minWM提供了一个难得的开放起点。有兴趣深入了解技术细节的读者,可以通过arXiv编号2605.30263查阅完整论文,或访问研究团队在GitHub上发布的代码仓库。
---
Q&A
Q1:minWM框架和普通AI视频生成模型有什么区别?
A:普通AI视频生成模型需要把整段视频全部算完才能输出,速度极慢,也无法实时互动。minWM框架的目标是把这类模型改造成能够一帧接一帧实时生成、同时响应相机控制指令的"互动式世界模型",最终在单张A800显卡上首帧延迟可以从十多分钟压缩到几秒钟。
Q2:训练minWM框架里的模型,对数据有什么特殊要求?
A:相机参数的精准度非常关键。研究发现,使用感知算法估算的相机参数(如SpatialVid数据)训练效果很差,模型学不会相机控制。需要使用"地面真值"相机轨迹,比如通过三维重建后重新渲染视频,或者用WorldPlay等已有世界模型生成的视频,才能让模型可靠地学会相机可控生成。
Q3:minWM蒸馏流程的三个阶段分别解决什么问题?
A:第一阶段把双向模型改成自回归模型,解决"边生成边输出"的问题;第二阶段做少步初始化,把每帧需要多步去噪压缩到极少步数,解决速度问题;第三阶段用原始高质量双向模型做分布对齐,弥补前两步导致的质量损失,让最终少步自回归模型的画质尽量接近原始模型。

05月25日 意甲第38轮 维罗纳vs罗马 全场录像回放
2026年06月29日
05月25日 意甲第38轮 都灵vs尤文图斯 全场录像回放
2026年06月29日
05月25日 意甲第38轮 AC米兰vs卡利亚里 全场录像回放
2026年06月29日
08月07日 WNBA常规赛 拉斯维加斯王牌vs印第安纳狂热 全场录像回放
2026年08月13日
08月02日 WNBA常规赛 纽约自由人vs菲尼克斯水星 全场录像回放
2026年08月03日
07月26日 WNBA全明星赛 韦瑟斯庞队vs库珀队 全场录像回放
2026年07月28日
07月20日 NBA夏季联赛 勇士vs灰熊 全场录像回放
2026年07月21日
07月20日 NBA夏季联赛 掘金vs猛龙 全场录像回放
2026年07月21日
07月20日 NBA夏季联赛 篮网vs雷霆 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 马刺vs太阳 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 步行者vs鹈鹕 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 勇士vs湖人 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 老鹰vs奇才 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 火箭vs灰熊 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 76人vs雄鹿 全场录像回放
2026年07月21日
07月19日 NBA夏季联赛 魔术vs凯尔特人 全场录像回放
2026年07月21日
07月18日 WNBA常规赛 西雅图风暴vs印第安纳狂热 全场录像回放
2026年07月19日
07月18日 NBA夏季联赛 森林狼vs快船 全场录像回放
2026年07月19日