关于ZAKER Skills 合作
雷锋网 54分钟前

顶会具身辩论赛实况:徐丹飞激辩,PI 连输三轮,谷歌大佬倒戈

数据从哪来?控制靠像素还是动作?

作者丨张 璐

编辑丨齐铖湧

在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:

要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的 " 具身数据 ",还是该拥抱浩瀚如海的 " 互联网与人类行为数据 "?

2026 年 RSS 大会最后一天的 workshop 圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。

来自 Georgia Tech 和 Nvidia 的徐丹飞,以组合世界模型的研究闻名;Google 与 NYU 的Sherry Yang,专注物理代理的世界模型评估与改进;Physical Intelligence 的Laura Smith,强调具身智能的实践落地;NVIDIA 的Max Li,长期深耕大模型架构;OpenDriveLab 的Li Chen,则在机器人数据与控制领域有丰富经验。

主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。雷峰网 AI 科技评论小队在现场记录下这场思想碰撞,以下是完整实录:

01

第一轮辩论:

世界模型和策略模型,应该合体还是分开?

大家都知道现在搞 AI 都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题——世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。

▎本轮对阵的双方是:

" 大一统 " 合体派: PI 科学家 Laura Smith、英伟达 Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)

" 各司其职 " 分开派: 谷歌 Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)

支持 " 合体 " 的一方认为,现在 AI 的大趋势就是 Everything in One。Laura 认为,MoE 模型都能把成百上千个专家塞进一个网络,为什么世界模型和策略不能合并?最终我们肯定想要一个超级模型,既能理解世界,又能直接行动。

她的观点得到了同阵营 Max Li 的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在 AI" 能想象到什么 " 和机器人 " 实际能做到什么 " 之间,其实存在着一条巨大的鸿沟。

视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。

听到这里,坐在 " 分开派 " 阵营的 陈立(Lee) 坐不住了,他直接从底层工程的 " 运行效率 " 出发,给合体派泼了一盆冷水。

陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。

要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试和特殊化处理。

陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:" 目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架,训练效果反而下降。"

她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。

徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处——调试和迭代更清晰

当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。

现场有观众立刻通过 Slido 提问:" 如果合并了,失败了到底怪谁?" 这个问题引起全场笑声,也让辩论更加接地气。最终,这一轮 " 分开派 " 在观众投票中略占优势。

第一轮辩完,现场观众的投票里,各司其职派胜过了大一统派,但嘉宾最后互相之间算是勉强达成了共识:世界模型和策略最好还是各回各家、各司其职。

但问题马上又来了,既然把世界模型单独拎出来了,那我们怎么知道这个模型到底有没有把这个世界 " 看懂、学对 " 呢?

是看它能不能像拍好莱坞大片一样,生成极其逼真的画面?还是看它能不能精准指导机器人的下一个动作?顺着这个话茬,两派圆桌嘉宾在第二轮直接陷入了更深层的技术纠结。

02

第二轮辩论:

可控性到底靠像素,还是动作?

到了第二轮,关于怎么控制世界模型的讨论,让上一轮的阵营直接打破重组,学术新星和产业专家开始各执一词

▎本轮对阵的是:

" 视觉颜值 " 像素派: Max Li、Laura Smith、陈立(主张视频画面最直观,是人类看懂大模型在想什么的便利接口)

" 硬核实操 " 动作派: 徐丹飞、Sherry Yang(中途根据实验修正立场)(主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值)

第二个问题更加技术化:世界模型的可控性,到底应该主要依赖生成真实像素(视频),还是更应该关注动作层面的 grounding?

支持像素派的英伟达科学家Max Li 一上来就金句频出。他认为视频是目前最自然、最有效的监督信号,而且他生动地打了个比方:生成高保真的视频,能让我们看清这个大模型到底在想什么——这就好比父母总想搞懂自己处于青春期叛逆孩子的内心想法一样。

英伟达的 Max 坚信,人类需要这种视觉上的高保真度,这能带来极佳的可解释性,是人类调试黑盒子系统最方便的接口。

同阵营来自 PI 的Laura Smith 顺着 Max 的话茬表达了支持。她认为,把未来的画面用视频直观地生动展示出来,最大的好处就是当机器人干砸了的时候,人类能一眼看过去进行 " 责任划分 "(blame assignment),瞬间揪出到底是哪个环节在推卸责任。

但支持动作 grounding 的反方很快泼了冷水。他们承认视频作为人类接口很有用,但指出过度追求像素级真实性有时反而是一种干扰和算力浪费

机器人最终要执行的是可靠的物理动作,而不是去拍一部奥斯卡电影。把算力都花在生成漂亮画面上,可能会牺牲动作的物理一致性和精度,尤其在接触丰富(contact-rich)的任务上。

面对两派的拉扯,Sherry Yang 在这一轮分享了自己的 " 倒戈 " 心路历程。她坦言,自己以前也是像素派的坚定支持者,但最近的大模型实验让她开始动摇。

因为她发现即使把模型规模做到极大,单纯靠堆像素和扩大规模,在遇到需要精细接触的任务时画面依然不够稳健。所以她现在更倾向于在视频生成中引入更多语义信息和物理先验,而不是单纯看画面好不好看。

徐丹飞 也表达了类似的观点。他一针见血地指出,视频其实只是现实世界的一个部分切片。人类在黑暗中摸索或者抓取物品时,根本不需要在脑子里想象出一幅画面,而是更依赖触觉和力反馈。

因此,判断一个世界模型好不好,核心不能看它画画美不美,而是要看它能不能产出真正的动作价值

这一轮讨论虽然没有明确赢家,但大家逐渐形成共识:视频和动作不是对立关系,而是需要更好结合。单纯靠哪一边都走不远。

讨论到这里,台上的气氛已经有点胶着了。大家发现,无论是追求炫酷的视频画面,还是死磕精细的手感反馈,说到底都是 " 下游 " 的应用和表现。

科学家们心里都清楚,再聪明的模型、再完美的算法,没有数据喂养也只是个空壳子。

那么,去哪里给机器人找最顶级、最管饱的 " 自学教材 "?是去白嫖铺天盖地的互联网人类视频,还是必须收集机器人自己的亲身体验?这也就是本场圆桌的最后一问。

03

第三轮辩论:数据该从哪里来?

最后一轮辩论直指根本问题:训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据?

" 借鉴全网 " 互联网视频派: 徐丹飞、Sherry Yang、Max Li(主张人类视频规模巨大,能极大提升机器人的泛化能力)

崇尚 " 亲身体验 " 具身控制派: 陈立、Laura Smith(主张互联网视频难救具体应用,高精度控制必须靠机器人自己的真实数据)

支持具身数据优先的专家认为,机器人数据包含真实的物理参数、动作反馈和接触力,是最 " 干净 "、最直接的信号。

没有这些,模型很难准确学到接触动力学等关键知识。具身数据才是地基,人类视频只是锦上添花。

甚至连作为 " 细节控 " 的 陈立(Lee) 这一轮也站出来公开表达了对互联网数据的怀疑。

他直言不讳地指出,现在业界一谈到大模型就盲目崇拜互联网上的海量数据,但在他看来,那些铺天盖地的互联网视频对机器人具体的、高精度的具身应用来说,并没有那么直接的帮助。

陈立认为,互联网视频顶多在宏观上帮机器人规划一个 " 子目标 "(sub-goals),但要解决底层的抓取和手脚控制,还是得死磕机器人自己的具身数据。

但支持人类 / 互联网数据的一方则从规模和泛化角度反驳。徐丹飞说:" 纯靠机器人数据,规模太有限,很难覆盖现实中的长尾场景。人类视频数据量巨大,包含各种各样的交互方式和技能组合,能极大提升模型的泛化能力。"

Sherry 补充道:" 人类本身就是地球上最强大的物理代理。我们可以把人类视频看作另一种‘机器人数据’,通过端到端控制或者姿态表示来对齐二者,这条路非常值得探索。"

尽管双方最终达成较高共识:两者都不可或缺。但现场观众依然对轮辩论给出了 " 现场法官 " 的评判:" 借鉴全网 " 互联网视频派,以 61% 的投票率,胜过了 39% 的崇尚 " 亲身体验 " 具身控制派。

当前阶段,如何高效利用人类视频数据、并通过世界模型把它和机器人数据桥接起来,可能是最重要的突破方向。

未来很可能形成一个混合数据飞轮:互联网数据提供广度,机器人数据提供精度,世界模型负责融合和迭代。

04

圆桌总结:技术仍在快速迭代中

三轮辩论结束后,既有输赢,又有共识。

先总结一下投票结果,从现场百位本届 RSS 参与学者的现场投票来看,第一轮世界模型和策略模型之争,现场投票中,各司其职派的说法更受现场台下学者们的拥护。

第二轮,世界模型的可控性,到底靠像素,还是动作问题上,现场投票更倾向于动作派,也就是主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值。

第三轮关于训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据的辩论中,现场投票更多的,是前者。

进行到这里,现场发生一个小插曲,来自 Physical Intelligence 的Laura Smith,在三次辩论的投票结果中,都输了,这也让她有一些困惑,但搁置争议,现场还是有很多共识。

几位嘉宾一致认为,世界模型是机器人走向通用的关键,但目前仍面临融合方式、可控性、数据利用等一系列挑战。

真正的突破,可能来自更聪明的组合机制、更平衡的数据策略,以及理论与工程的紧密结合

徐丹飞在最后说:" 我们现在看到的只是冰山一角。未来几年,这个领域会非常热闹。"

现场观众报以热烈掌声。这场圆桌没有标准答案,却留下了大量值得深入思考的问题——这或许正是学术会议最迷人的地方。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容