
作者丨张 璐
编辑丨齐铖湧
在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:
要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的 " 具身数据 ",还是该拥抱浩瀚如海的 " 互联网与人类行为数据 "?
2026 年 RSS 大会最后一天的 workshop 圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。
来自 Georgia Tech 和 Nvidia 的徐丹飞,以组合世界模型的研究闻名;Google 与 NYU 的Sherry Yang,专注物理代理的世界模型评估与改进;Physical Intelligence 的Laura Smith,强调具身智能的实践落地;NVIDIA 的Max Li,长期深耕大模型架构;OpenDriveLab 的Li Chen,则在机器人数据与控制领域有丰富经验。
主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。雷峰网 AI 科技评论小队在现场记录下这场思想碰撞,以下是完整实录:
01
第一轮辩论:
世界模型和策略模型,应该合体还是分开?
大家都知道现在搞 AI 都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题——世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。
▎本轮对阵的双方是:
" 大一统 " 合体派: PI 科学家 Laura Smith、英伟达 Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)
" 各司其职 " 分开派: 谷歌 Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)

她的观点得到了同阵营 Max Li 的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在 AI" 能想象到什么 " 和机器人 " 实际能做到什么 " 之间,其实存在着一条巨大的鸿沟。
视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。
听到这里,坐在 " 分开派 " 阵营的 陈立(Lee) 坐不住了,他直接从底层工程的 " 运行效率 " 出发,给合体派泼了一盆冷水。
陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。
要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试和特殊化处理。
陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:" 目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架,训练效果反而下降。"
她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。
徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处——调试和迭代更清晰。
当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。

第一轮辩完,现场观众的投票里,各司其职派胜过了大一统派,但嘉宾最后互相之间算是勉强达成了共识:世界模型和策略最好还是各回各家、各司其职。
但问题马上又来了,既然把世界模型单独拎出来了,那我们怎么知道这个模型到底有没有把这个世界 " 看懂、学对 " 呢?
是看它能不能像拍好莱坞大片一样,生成极其逼真的画面?还是看它能不能精准指导机器人的下一个动作?顺着这个话茬,两派圆桌嘉宾在第二轮直接陷入了更深层的技术纠结。
02
第二轮辩论:
可控性到底靠像素,还是动作?
到了第二轮,关于怎么控制世界模型的讨论,让上一轮的阵营直接打破重组,学术新星和产业专家开始各执一词。
▎本轮对阵的是:
" 视觉颜值 " 像素派: Max Li、Laura Smith、陈立(主张视频画面最直观,是人类看懂大模型在想什么的便利接口)
" 硬核实操 " 动作派: 徐丹飞、Sherry Yang(中途根据实验修正立场)(主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值)
第二个问题更加技术化:世界模型的可控性,到底应该主要依赖生成真实像素(视频),还是更应该关注动作层面的 grounding?

英伟达的 Max 坚信,人类需要这种视觉上的高保真度,这能带来极佳的可解释性,是人类调试黑盒子系统最方便的接口。
同阵营来自 PI 的Laura Smith 顺着 Max 的话茬表达了支持。她认为,把未来的画面用视频直观地生动展示出来,最大的好处就是当机器人干砸了的时候,人类能一眼看过去进行 " 责任划分 "(blame assignment),瞬间揪出到底是哪个环节在推卸责任。
但支持动作 grounding 的反方很快泼了冷水。他们承认视频作为人类接口很有用,但指出过度追求像素级真实性有时反而是一种干扰和算力浪费。
机器人最终要执行的是可靠的物理动作,而不是去拍一部奥斯卡电影。把算力都花在生成漂亮画面上,可能会牺牲动作的物理一致性和精度,尤其在接触丰富(contact-rich)的任务上。
面对两派的拉扯,Sherry Yang 在这一轮分享了自己的 " 倒戈 " 心路历程。她坦言,自己以前也是像素派的坚定支持者,但最近的大模型实验让她开始动摇。

徐丹飞 也表达了类似的观点。他一针见血地指出,视频其实只是现实世界的一个部分切片。人类在黑暗中摸索或者抓取物品时,根本不需要在脑子里想象出一幅画面,而是更依赖触觉和力反馈。

这一轮讨论虽然没有明确赢家,但大家逐渐形成共识:视频和动作不是对立关系,而是需要更好结合。单纯靠哪一边都走不远。
讨论到这里,台上的气氛已经有点胶着了。大家发现,无论是追求炫酷的视频画面,还是死磕精细的手感反馈,说到底都是 " 下游 " 的应用和表现。
科学家们心里都清楚,再聪明的模型、再完美的算法,没有数据喂养也只是个空壳子。
那么,去哪里给机器人找最顶级、最管饱的 " 自学教材 "?是去白嫖铺天盖地的互联网人类视频,还是必须收集机器人自己的亲身体验?这也就是本场圆桌的最后一问。
03
第三轮辩论:数据该从哪里来?
最后一轮辩论直指根本问题:训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据?
" 借鉴全网 " 互联网视频派: 徐丹飞、Sherry Yang、Max Li(主张人类视频规模巨大,能极大提升机器人的泛化能力)
崇尚 " 亲身体验 " 具身控制派: 陈立、Laura Smith(主张互联网视频难救具体应用,高精度控制必须靠机器人自己的真实数据)

没有这些,模型很难准确学到接触动力学等关键知识。具身数据才是地基,人类视频只是锦上添花。
甚至连作为 " 细节控 " 的 陈立(Lee) 这一轮也站出来公开表达了对互联网数据的怀疑。
他直言不讳地指出,现在业界一谈到大模型就盲目崇拜互联网上的海量数据,但在他看来,那些铺天盖地的互联网视频对机器人具体的、高精度的具身应用来说,并没有那么直接的帮助。

但支持人类 / 互联网数据的一方则从规模和泛化角度反驳。徐丹飞说:" 纯靠机器人数据,规模太有限,很难覆盖现实中的长尾场景。人类视频数据量巨大,包含各种各样的交互方式和技能组合,能极大提升模型的泛化能力。"
Sherry 补充道:" 人类本身就是地球上最强大的物理代理。我们可以把人类视频看作另一种‘机器人数据’,通过端到端控制或者姿态表示来对齐二者,这条路非常值得探索。"
尽管双方最终达成较高共识:两者都不可或缺。但现场观众依然对轮辩论给出了 " 现场法官 " 的评判:" 借鉴全网 " 互联网视频派,以 61% 的投票率,胜过了 39% 的崇尚 " 亲身体验 " 具身控制派。

未来很可能形成一个混合数据飞轮:互联网数据提供广度,机器人数据提供精度,世界模型负责融合和迭代。
04
圆桌总结:技术仍在快速迭代中
三轮辩论结束后,既有输赢,又有共识。
先总结一下投票结果,从现场百位本届 RSS 参与学者的现场投票来看,第一轮世界模型和策略模型之争,现场投票中,各司其职派的说法更受现场台下学者们的拥护。
第二轮,世界模型的可控性,到底靠像素,还是动作问题上,现场投票更倾向于动作派,也就是主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值。
第三轮关于训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据的辩论中,现场投票更多的,是前者。
进行到这里,现场发生一个小插曲,来自 Physical Intelligence 的Laura Smith,在三次辩论的投票结果中,都输了,这也让她有一些困惑,但搁置争议,现场还是有很多共识。
几位嘉宾一致认为,世界模型是机器人走向通用的关键,但目前仍面临融合方式、可控性、数据利用等一系列挑战。
真正的突破,可能来自更聪明的组合机制、更平衡的数据策略,以及理论与工程的紧密结合。
徐丹飞在最后说:" 我们现在看到的只是冰山一角。未来几年,这个领域会非常热闹。"
现场观众报以热烈掌声。这场圆桌没有标准答案,却留下了大量值得深入思考的问题——这或许正是学术会议最迷人的地方。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。