当前位置:首页 >新闻 >篮球新闻 / 科特迪瓦VS挪威直播_科特迪瓦VS挪威无插件免费高清观看_科特迪瓦VS挪威直播赛事直播

篮球新闻

科特迪瓦VS挪威直播_科特迪瓦VS挪威无插件免费高清观看_科特迪瓦VS挪威直播赛事直播

24直播网 2026-07-01 01:50:48 篮球新闻
这项由清华大学、中国人民大学、香港科技大学及德克萨斯大学奥斯汀分校联合完成的研究,以论文编号

这项由清华大学、中国人民大学、香港科技大学及德克萨斯大学奥斯汀分校联合完成的研究,以论文编号arXiv:2605.30263v1于2026年5月28日公开发布,背后的产业支持来自生数科技(ShengShu)团队。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。

一、一个让AI"导演"能实时控制镜头的梦想

当你打开一款游戏,随手拨动摇杆,镜头便跟着向左推移,眼前的虚拟世界随之流畅展开——这种体验之所以让人沉浸其中,核心在于两件事:镜头听你的话,而且画面几乎不卡。现在,如果把这个"虚拟世界"换成一个由AI实时生成的视频场景,你就能理解这篇论文想解决的核心问题了。

过去几年,AI视频生成技术飞速进步,各类模型已经能够生成画质精美、时间连贯的视频片段。但这些模型有一个致命短板:它们像一位只会拍长片的导演,每次都要把整段视频从头到尾生成完毕才交给你看,根本无法边拍边给你看,更别说根据你实时的操控指令来调整镜头了。换句话说,它们很擅长"创作",却不擅长"互动"。

于是,一个自然而然的问题出现了:能不能把这些高质量的AI视频生成模型,改造成真正能实时互动、实时响应镜头控制的"视频世界模型"?这正是minWM这个开源框架想要回答的问题。

二、从"画卷"到"实时直播"——改造一个AI导演有多难

在理解minWM的解决方案之前,有必要先搞清楚现有AI视频模型的工作方式,以及改造它们面临的真正挑战。

现有的主流AI视频生成模型,在技术上被称为"双向扩散模型"。用一个直观的比喻来理解:这类模型就像一位需要整体构思后才动笔的画家,他会在脑海中把整幅画的每一处细节都想清楚,然后一次性落笔完成。正因为它在生成时可以"前后参照"整段视频的所有帧,所以画质非常高。但代价是,它必须等整幅画都完成了才能给你看——在一台A800显卡上,生成一段视频的首帧延迟高达771秒,差不多13分钟。这对于需要实时互动的场景来说,完全不可接受。

要实现实时互动,模型必须转变为"自回归"方式工作——也就是像说话一样,一帧接一帧地向前生成,生成完一帧立刻输出,不需要等整段视频完成。这样用户就能边看边操控。但这个转变并不简单,因为一旦模型失去了"前后参照整段视频"的能力,生成质量往往会大幅下降,还会产生所谓的"暴露偏差"问题——模型在训练时看到的是真实视频帧,但在实际推理时却要依赖自己刚刚生成的帧作为输入,两者之间的差异会随着时间累积,导致视频越往后质量越差,甚至出现画面漂移。

不仅如此,哪怕模型变成了自回归方式,如果每次生成一帧还需要做几十步的去噪运算,延迟依然令人发指。因此,还需要进一步把模型"提速"到只需要极少步骤(比如4步)就能生成一帧的程度,这个过程被称为"少步蒸馏"。

把以上所有挑战放在一起:你需要的数据要有精准的相机参数标注,你需要对模型进行可控性微调,你需要做自回归训练,你需要做少步蒸馏,你还需要优化推理效率。这整条流水线,之前从来没有一个统一、开源、可复现的框架把它们串在一起。这正是minWM填补的空白。

三、一条完整的"改造流水线"——minWM的工作原理

minWM的设计思路,可以类比成一家汽车改装厂的完整工序。原始的双向视频扩散模型就像一辆性能出色但只适合赛道的赛车,外观漂亮、马力强劲,但完全不适合日常道路上的实时驾驶互动。改装厂(也就是minWM)要把它变成一辆既好看、又能实时响应方向盘操控、还能高速行驶的智能汽车。

整个改造流程分为两大阶段,第一阶段是给模型装上"镜头控制系统",第二阶段是把模型的工作方式从"慢速全局计算"改为"快速实时生成"。

第一阶段的核心技术叫做PRoPE(射影相对位置编码)。相机控制的本质,是告诉模型"摄影机在哪里、朝哪里看、镜头焦距是多少",并让模型据此生成符合该视角的画面。PRoPE的做法是把每一帧的相机参数——包括内参矩阵(决定镜头焦距和畸变)和外参矩阵(决定相机的空间位置和朝向)——编码成一种特殊的数学变换矩阵,然后把这个矩阵注入到模型的自注意力机制中。自注意力机制可以理解为模型在处理视频帧时"思考各帧之间关系"的核心模块。通过这种注入方式,模型在"思考"任意两帧之间的关系时,会自动考虑到这两帧对应的相机视角差异,从而学会根据相机轨迹来生成视频。这种方式的优雅之处在于,它不需要改变模型原有的注意力结构,只是在计算注意力时引入了相机信息,保留了原始模型的生成能力。

第二阶段的流程由三个步骤串联而成,研究团队将其称为"因果强制(Causal Forcing)"或"因果强制++(Causal Forcing++)"。

第一步是自回归扩散训练。从上一阶段得到的具有相机控制能力的双向模型出发,通过一种叫做"teacher forcing"的训练方式,把它改造成一个自回归扩散模型。具体做法是把干净的视频帧和加了噪声的视频帧拼接在一起,并在训练时使用因果注意力掩码——也就是让模型在生成第N帧时只能看到第N帧之前的内容,不能偷看未来的帧。经过这一步,模型就具备了自回归生成能力,能够一帧接一帧地向前生成视频。但此时每帧还需要多步去噪,速度依然不够快,而且由于自回归的暴露偏差,质量也弱于双向模型。

第二步是初始化少步模型。这里有两种方案可选。方案一叫做"因果ODE初始化":让上一步训练好的自回归扩散模型,对大量视频帧生成完整的去噪轨迹(即PF-ODE轨迹),然后在这些轨迹数据上训练一个少步模型,使其能够从加噪的中间帧直接"跳跃"到干净帧,跳过大量中间去噪步骤。方案二叫做"因果一致性蒸馏(Causal CD)":由于方案一需要大量预先生成ODE数据,既耗时又占存储,因果强制++提出了理论上等价的替代方案——直接通过一致性条件进行在线训练,无需离线生成ODE轨迹。具体来说,就是让当前模型的预测结果与经过一步ODE推进后再用EMA(指数移动平均)版本模型预测的结果保持一致,同时配合时间步相关的权重函数和距离度量来约束训练。两种方案的最终效果是等价的,但后者在工程上更高效。

第三步是非对称分布匹配蒸馏(Asymmetric DMD)。经过前两步,模型已经能够少步自回归生成,但由于整个蒸馏过程的"老师"是质量有限的自回归模型,学生自然也继承了老师的局限性,生成质量距离原始双向模型仍有差距。这一步的作用,就是让少步自回归模型向原始高质量双向模型"对齐"。具体机制是:让少步学生模型自主展开生成一段完整视频,然后把生成的视频加入噪声,分别用一个冻结的双向模型(代表"真实数据分布的评分")和一个在线更新的判别模型(代表"当前生成分布的评分")来估算两个分布之间的差异,并以此梯度指导学生模型的参数更新。这个过程就像让学徒不断临摹大师的风格,而不是只靠中等老师的指导——最终学徒的作品质量会向大师靠拢。

值得一提的是,整个蒸馏流程对相机控制是完全透明的。无论是第一步的自回归训练,还是第二步的ODE数据生成或一致性蒸馏,还是第三步的分布对齐,所有阶段都在带有相机条件的数据上进行,所有参与的模型都具备相机条件能力,确保相机控制能力在整个蒸馏过程中得以保留而不流失。

四、两个实例——把理论变成真实可用的模型

研究团队选择了两个代表性的开源视频基础模型作为改造对象,分别是Wan2.1-T2V-1.3B(文本到视频,13亿参数)和HY1.5-TI2V-8B(文本加图像到视频,80亿参数)。选择这两个模型有其深意:前者采用交叉注意力机制来注入条件信息,后者采用MMDiT架构(一种将文本和图像特征在同一Transformer中联合处理的结构),两种架构代表了当前主流视频扩散模型的两大设计路线,证明了minWM框架的架构通用性。

在训练设置上,两个模型都被训练生成分辨率为480×832像素、共77帧的视频,自回归的"块大小"为4个潜在帧(潜在帧是视频在编码器压缩后的表示,比原始像素帧更紧凑)。少步蒸馏统一使用4步推理。HY1.5系列的训练使用批大小32、学习率1×10??,双向模型训练8000步,随后依次进行4000步、1500步、500步的三阶段蒸馏。Wan2.1系列使用批大小32、学习率2×10??,双向模型训练5000步,随后进行4000步、2000步、200步的三阶段蒸馏。

改造完成后的性能提升令人印象深刻。在单张A800显卡上测量首帧延迟(即从开始运行到生成出第一帧画面所需的时间,不含VAE解码时间),原始HY1.5双向模型需要771秒,改造成多步自回归模型后降至81秒,最终的少步自回归模型仅需3.446秒,相较于原始双向模型实现了223.75倍的加速。Wan2.1的情况同样出色:原始双向模型需要269秒,多步自回归版本降至28.6秒,最终少步自回归版本仅需1.137秒,实现了236.64倍的加速。

这里有一点值得理解清楚:双向模型之所以首帧延迟那么高,是因为它必须先生成整段视频才能给你第一帧。而自回归模型则是生成完第一帧就立刻输出,后续帧在你观看第一帧的同时继续生成。因此在实际应用中,自回归模型的用户体验改善远不止数字所呈现的倍数,它让"边生成边观看"成为可能。

五、数据是成败的关键——三种路线的对比实验

模型能否学会根据相机指令生成正确视角的画面,数据质量起着决定性作用。研究团队在训练数据的选择上做了大量实验,总结出了三条路线,每条路线的结果都大相径庭。

第一条路线是使用SpatialVid数据集。这个数据集包含大量带有相机参数标注的视频,但这些相机参数是通过计算机视觉算法从视频中"感知估算"出来的,并非真实测量值。实验结果令团队失望:无论是HY1.5还是Wan2.1,在这份数据上训练出来的模型都无法可靠地执行相机控制指令,即便进行了额外的数据过滤,问题依然存在。研究团队推测,感知估算出来的相机姿态本身含有噪声,且可能存在轨迹不一致的问题,这使得模型难以从中学到清晰的相机-画面对应关系。需要特别说明的是,这个结论针对的是他们当前的训练设置,并不代表SpatialVid数据集本身没有价值,更精细的过滤和姿态优化可能会改善这一问题,研究团队也把这一方向留作了未来工作。

第二条路线是从DL3DV数据集出发,通过三维重建和重新渲染来获得视频数据。DL3DV是一个大规模的真实场景数据集,研究团队先用三维重建技术从中重建出三维场景,然后沿着预设的相机轨迹渲染视频。这条路线的优势在于,渲染出来的视频和对应的相机参数是完全精确对应的"地面真值",没有任何估算误差。实验证明,在这份数据上训练的模型能够成功学会相机可控生成,达到了很好的效果。

第三条路线是为开源版本专门设计的方案:从OpenVid等图像数据集中采样图像,然后利用WorldPlay(一个已有的视频世界模型)根据指定的相机轨迹生成视频。由于WorldPlay本身就是一个具有几何一致性的视频生成系统,它输出的视频也具有可信赖的地面真值相机轨迹。实验表明,这条路线同样能让模型学会相机可控生成,且更适合开源场景,因为不需要复杂的三维重建流程。

六、训练步数与批大小——两个影响成功的关键细节

除了数据质量,研究团队还做了两组非常实用的消融实验,给出了训练步数和最小批大小的具体建议,这对于想要复现或迁移这项工作的研究者来说具有直接的参考价值。

关于训练步数,以HY1.5为例,研究团队观察到相机可控性是逐步涌现的。在仅训练一两千步时,模型几乎完全不响应相机控制指令,生成的画面与相机轨迹毫无关联。到五千步左右,模型开始能够响应相机信号,但表现仍然不稳定,时好时坏。当训练推进到八千步时,模型达到了强可控性,能够可靠、稳定地根据相机轨迹生成正确视角的视频。这说明,相机可控性的学习并非一蹴而就,需要足够多的训练轮次让模型真正内化这一能力。

关于批大小,以Wan2.1为例,研究团队发现这是一个不能随意缩减的超参数。当批大小小于4时,模型很难学会相机可控性,几乎必然失败。当批大小提升到8时,可控性有了大幅改善,但仍然不够稳定。只有当批大小达到16时,完整的训练流程才能顺利完成,并获得高质量的相机可控性。这对于计算资源有限的研究者而言是一个实用的下限指标:至少需要16的批大小才能保证成功。

七、不只是一个新模型,而是一套可复用的工具箱

minWM的定位与一般论文有所不同。大多数视频生成论文以展示单一最优模型的生成结果为核心,而minWM的目标是提供一套可复用、可扩展的完整工具链。这体现在几个具体方面。

研究团队发布了每个训练阶段的中间检查点,而不只是最终模型。这意味着其他研究者可以从任意一个中间阶段接力,无需重新从头训练整条流水线,大大降低了计算成本。同时,推理代码、训练脚本和使用文档也一同开源,确保论文中的结果可以被独立复现。

框架还支持对已有视频世界模型进行适配,而不仅仅是从零开始转换。以HY-WorldPlay为例,minWM支持把这类现成的视频世界模型迁移到新的数据分布、调整训练配方,或者进一步压缩到更低的推理延迟目标。这意味着,即使某个研究团队已经训练好了一个视频世界模型,也可以借助minWM的蒸馏流程把它改造得更快、更灵活,而无需重复上游的大量工作。

在推理端,minWM也做了相应的工程优化,包括针对流式场景的DiT去噪和VAE解码的流水线设计。VAE(变分自编码器)是把潜在空间的视频表示解码为可见像素画面的模块,在流式推理中需要与扩散去噪步骤并行或交织进行,才能实现视频边生成边播放的效果。

归根结底,这项研究最大的贡献不是某一个更强的视频模型,而是把过去散落在各处的技术拼图——数据构建、相机控制、自回归训练、少步蒸馏、流式推理——第一次系统地组装成一条完整且开源的生产线,让更多研究者可以站在这条生产线的基础上继续往前走,而不是每次都从零开始重建。

当然,这项工作也有明确的局限性和未尽之处。目前支持的控制条件只有相机运动,未来团队计划引入更多控制维度,比如人体姿态控制。同时,基于感知估算相机姿态的数据(如SpatialVid)在当前设置下效果欠佳这一问题,也留待后续研究通过更精细的数据处理来解决。这些开放问题本身也构成了这篇论文给社区留下的研究空间。

由此可见,对于那些希望探索交互式视频生成、视频世界模型或应用的研究者来说,minWM提供了一个难得的开放起点。有兴趣深入了解技术细节的读者,可以通过arXiv编号2605.30263查阅完整论文,或访问研究团队在GitHub上发布的代码仓库。

---

Q&A

Q1:minWM框架和普通AI视频生成模型有什么区别?

A:普通AI视频生成模型需要把整段视频全部算完才能输出,速度极慢,也无法实时互动。minWM框架的目标是把这类模型改造成能够一帧接一帧实时生成、同时响应相机控制指令的"互动式世界模型",最终在单张A800显卡上首帧延迟可以从十多分钟压缩到几秒钟。

Q2:训练minWM框架里的模型,对数据有什么特殊要求?

A:相机参数的精准度非常关键。研究发现,使用感知算法估算的相机参数(如SpatialVid数据)训练效果很差,模型学不会相机控制。需要使用"地面真值"相机轨迹,比如通过三维重建后重新渲染视频,或者用WorldPlay等已有世界模型生成的视频,才能让模型可靠地学会相机可控生成。

Q3:minWM蒸馏流程的三个阶段分别解决什么问题?

A:第一阶段把双向模型改成自回归模型,解决"边生成边输出"的问题;第二阶段做少步初始化,把每帧需要多步去噪压缩到极少步数,解决速度问题;第三阶段用原始高质量双向模型做分布对齐,弥补前两步导致的质量损失,让最终少步自回归模型的画质尽量接近原始模型。