关于ZAKER Skills 合作
雷锋网 33分钟前

佐治亚理工学院徐丹飞:别被「视觉生成」骗了,视频预测≠机器人规划

解构组合式世界模型,用因子图与时间注意力跨越 " 视行断层 "

作者丨张 璐

编辑丨齐铖湧

当前的具身智能与世界模型领域,正面临着一个尴尬的现状。

随着以 Sora 为代表的高保真视频生成技术走向成熟,模型已经能够为机器人构建出极其逼真的未来画面,让人感觉 AGI 似乎触手可及。

但回到真实的物理世界,令人困惑的现象出现了:即便模型能够预测出完美的未来画面,机械臂在实际落地执行时依然频频失效。

这暴露出了行业内长期被忽视的一个核心矛盾——能够 " 生成 " 成功的结果,绝不等同于拥有真正的 " 规划能力 "。 面对未曾见过的长流程任务与复杂的物理约束,机器人陷入了 " 看得懂画面,做不出动作 " 的瓶颈。

在近期一场顶尖学术会议的现场,佐治亚理工学院助理教授、NVIDIA 研究员徐丹飞(Danfei Xu)直击这一症结,分享了他的破局思路。

在他的主旨演讲《Compositional World Models》(组合式世界模型)中,徐丹飞提出了一套利用模块化与因子图(Factor Graphs)的解法,主张让机器人像搭积木一样,在测试阶段动态拼装基础技能;同时,他也首次深刻剖析了视频预测与真实控制之间的" 视频 - 动作跨越断层(Video-Action Gap)"。

以下为徐丹飞在大会上的演讲精编,雷峰网 AI 科技评论在不改变原意的基础上进行了整理与译介:

01

别被 " 脑补画面 " 骗了:

视觉生成并不等于物理规划

今天想和大家聊聊我们在实验室坚持做了很久的一个方向——组合式世界模型。

毫无疑问,世界模型(World Models)是当下整个机器人领域最受关注的技术路线之一。从早年结合线性动力学进行视频控制,到如今扩散模型带来的高保真视频生成,大家都渴望构建出一个 " 通用规划器 " ——让机器人先在脑海中预演成功的未来,然后照此执行。

但这其中隐藏着一个根本性的认知误区:高保真的画面生成,并不等同于物理意义上的规划。

举个具体的例子,假设我们给机器人设定一个复合任务—— " 把重物放进冰箱 "。在已有的训练数据中,模型可能分别掌握了 " 双手抱重物 "、" 打开冰箱门 " 以及 " 高位摆放 " 这几个独立技能。

但如果让它面对一个从未组合过的全新场景呢?

如果完全依赖生成模型,它或许能基于数据分布合成出一段看似合理的 " 预测视频 ",但在真实物理执行时,往往会违背最基本的物理约束——例如尝试在双手紧抱重物的同时去拉开冰箱门,甚至在冰箱门尚未开启时就试图将物体放入。

生成(Generation),是在已有数据分布中提取高概率的预测结果;而规划(Planning),则必须在测试阶段(Test-time),针对新的长流程与物理限制,实时构造出数据集中从未存在过的 " 有效解(Valid Solution)"。

要打破这一局限,我们需要两项核心要素:具备泛化能力的先验表达,以及目标导向的测试期组合机制(Goal-directed Test-time Composition)

02

像搭积木一样拼技能:

用因子图破解长流程难题

受 AI 先驱马文 · 明斯基(Marvin Minsky)思想的启发,我们的核心思路在于:将复杂的系统解耦为多个简单的模块化组件,并在测试阶段进行动态组合。

当我们需要按顺序执行两个技能时,逻辑类似于接力赛——前一个技能终止时的状态分布,必须精准覆盖后一个技能能够成功启动的起始状态区间。这个重叠的状态交集,就是技能之间能否实现顺畅衔接的 " 契约 "。

然而,如果仅采用传统的单线串联方式(Linear Chaining),信息的传递效率会极其低下。假设第 10 步的抓握方式直接决定了第 1 步的准备姿态,信息就需要在整条链路上进行多轮震荡与迭代。

为此,我们将这种链式结构扩展为了因子图(Factor Graphs)。借助因子图,我们可以在时空维度上自由定义各种约束条件:

空间维度: 精确约束机械臂末端与目标物体之间的相对姿态;

时间维度: 确保物体在移动过程中与机械臂保持物理同步;

多臂协同: 过去我们需要专门采集大量的双手协同数据,而现在,只需训练好单臂技能,在测试时通过因子图将两个单臂模型进行约束组合即可。

在这种机制下,机器人能够顺利完成单臂难以应对的复杂任务——例如双手协同抬起沉重的双耳锅并旋转角度,或者左手递出锤子、右手精准接住并敲击钉子。

03

为什么眼会了手还是不会?

揭秘 " 视频与动作 " 的断层

在研究深入的过程中,我们遇到了一个极其关键的工程瓶颈:即便世界模型预测出了一段完美无瑕的未来视频,机器人的真实动作依然可能无法跟随这一预测。

这一现象背后的本质原因在于——目前的视频大模型吸收了全网极高量级的视觉数据,具备了极强的泛化能力;而机器人底层的动作(Action)数据却极其匮乏。这就导致视频生成模型已经成功泛化到了新场景,但动作控制模型却出现了泛化滞后。

为了量化这一断层现象,我们提出了一个全新的测量指标——时间注意力比例(Temporal Ratio),用以诊断模型在实时控制过程中,究竟将注意力权重分配给了 " 预测的未来 " 还是 " 眼前的当下 "。

通过这一指标,我们发现了具身控制中的一个重要规律:

当机器人处于接近目标(Reaching)阶段时,它高度依赖对未来的轨迹预测,Temporal Ratio 显著偏高;

而一旦进入物理接触与抓取(Grasping)阶段,它的注意力会瞬间回归到 " 当前帧 ",转而由实时的触觉与视觉微调主导。

基于这一洞察,我们可以在测试期引入策略引导(Policy Guidance):在接近目标时强化模型对未来的前瞻注意力,在接触物体的瞬间拉回注意力关注当下。这套方法显著提升了模型在面对分布外(OOD)复杂任务时的真实执行成功率。

规划的本质,远不止于 " 预测出合理的未来视觉 "。要推动具身智能真正迈向落地,我们必须攻克 " 在测试阶段确定组合对象(What to compose)与组合机制(How to compose)" 的底层难题。

只有当机器人的真实动作能够精准对齐并执行那些预演的视觉未来时,世界模型的潜能才算得到了真正的释放。

谢谢大家!

04

现场对撞:关于数据、世界模型

与策略模型的深层思考

▎ Q1:目前的论文和产业实践大多聚焦于利用 " 成功的轨迹 " 进行预测,你如何看待训练数据中的 " 失败样本(Failures)"?将失败数据引入扩散模型训练具有怎样的学术或工程价值?

徐丹飞: 目前大家普遍偏好成功数据,核心原因在于我们在测试阶段尚缺乏一个足够高效的规划器去消化和利用 " 失败视频 "。一旦我们构建出能够深刻理解物理约束的规划算法,预测 " 某种动作会导致失败 " 的价值绝不亚于预测成功。

另一方面,现有的视频大模型几乎全部基于人类日常成功的活动数据进行训练,数据集中缺乏天然的失败案例。未来如果我们有意识地去捕获那些边缘与失败轨迹,对于拓展世界模型的安全边界将带来质的飞跃。

Q2:在圆桌辩论环节,针对 " 世界模型(World Model)应该与策略模型(Policy)融合成单一模型,还是保持分立 " 这一争议,你的核心立场是什么?

徐丹飞: 我倾向于保持两者的分立与独立性,主要基于两点考虑:

第一,模型目前依然处于严重的欠拟合(Underfitting)状态。面对互联网极其庞大的视频与具身数据集,现有的模型容量远未饱和。如果在一个本就在努力拟合物理世界规律的模型中强行引入 Policy 的控制目标,会大幅增加预训练的收敛难度。

第二,两者对数据利用方式(Data Consumption)的本质差异。Policy 的终极目标是输出精准的控制指令,天然偏好高质量的成功数据(更适合 SFT 或强化学习精调);而世界模型则需要吞下海量的失败与异常数据,才能完整构建对物理世界全貌的认知。将两者解耦、各司其职地进行优化,是当前更为稳妥且高效的工程路径。

一个人读论文太孤单,一群人刷顶会才好玩。

RSS 2026 召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪硬核技术探讨,拒绝灌水。

? 进群传送门: 扫码进群或添加微信 Luyoyo_2026,备注:论文群 + 关注的 AI 方向

搞科研 / 搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容