
如果说过去两年人工智能行业的绝对主角是大语言模型(LLM),那么今年无疑是各类形态各异的具身智能机器人与空间智能设备。
在这个 WAIC 2026 展区中,被层层围观、讨论最密集的赛道,从技术极客到产业资本,所有人抛出一个共同的疑问:具身智能的 "ChatGPT 时刻 " 究竟何时到来?
在这场关于下一代计算范式和人工智能物理形态的竞速中,底层路线的分歧与收敛正在以前所未有的速度上演。
"2026 年为‘世界模型元年’,标志着 AI 从内容生成走向对物理世界的理解与交互的关键转折。" 昆仑万维董事长兼 CEO 方汉在 " 世界模型与多模态范式跃迁 " 专场论坛上断言。
论坛结束后,我们与方汉进行了一场对话。从世界模型的端到端演化、Scaling Law 在视频与物理世界的延续,到一笔高达数百亿的 " 数据经济账 ",他描绘了一幅相对清晰的产业路线图。
当我们追问行业真正的分化节点何时到来时,方汉的回归了本质的技术信条:数据量级。百万小时、千万小时、上亿小时,这是一个阶级分明的坐标系。
无论是文本大模型的走向收敛,还是世界模型对 DiT 架构的统一,技术底层的逻辑正在变得透明。真正的壁垒,已经转移到了企业对异构数据的清洗能力、算法的迭代速度,以及最粗暴的资金与硬件筹措能力上。
2026 年,站在世界模型元年的风口上,具身智能已经完成了从技术黑盒到工程流水线 的思想转变。而这场重塑物理世界交互法则的战役,才刚刚打响。
以下是我们这次对话五个核心观点。
一、路线大一统:端到端世界模型与 " 千万小时 " 定律
当前具身智能正处于起步探索阶段,百花齐放,却在某种程度上像是在迷雾中穿行,方汉认为,可以对标的一个坐标系——自动驾驶。
" 我觉得可以用自动驾驶来做一个参照。大家都知道自动驾驶经过多种技术路线的角逐,最后全部收敛到了端到端的 FSD 系统上。" 方汉表示。
他强调,具身智能和世界模型最终也必定会走向端到端的架构,因为只有这种架构才能实现真正意义上的 "Scaling Up(规模扩展)"。
在此之前,多流派的探索在解决长尾场景和泛化性时显得捉襟见肘。而端到端模型的破局,关键在于跨越数据量的 " 奇点时刻 "。方总以视频生成模型的发展作为类比:视频模型沉寂多年,直到训练规模达到 "20 亿个 15 秒的切片 " 时,才终于迎来了质的飞跃。
目前的进度条走到哪里了?据方汉透露,各大头部厂商目前普遍处于 10 万到 20 万小时的阶段。这意味着,行业正处于冲刺百万小时、千万小时关口的竞速期。他预测,今年底或许有厂商能达到百万小时级别,而千万小时的拐点极有可能在明年底由头部厂商率先突破。
二、异构数据破局:一场从 500 亿到 1 亿元的 " 算账革命 "
如果 Scaling Law 是毋庸置疑的真理,那么横亘在所有企业面前的唯一挑战就是——算账。在千万小时甚至亿级小时的数据需求面前,具身智能的数据采集模式,在商业逻辑上似乎完全失效。
方汉为我们算了一笔略显残酷的账:在早期,具身智能的数据主要分为 UMI 数据和真机数据。这种数据的生产成本极高。
以最基础的数据采集设备为例,原本单副采集手套的成本就高达十几万元,直到今年才勉强降至一万多元。在此设备基础上,单位小时的 UMI 和真机数据采集成本最低也需要 500 元人民币,高的甚至达到一两千元。
" 我们可以算一下,如果要生产 1000 万小时的真机数据,乘以 500 元的单价,至少需要 50 亿元。如果是 1 亿小时的数据,那就是 500 亿元。这个成本是谁都架不住的。" 方汉坦言。
打破这一资本黑洞的终极武器,被确认为异构数据(Heterogeneous Data)。
" 异构数据的出现,比如用手机、甚至胸挂摄像头拍摄的人手操作数据,使得采购成本大幅下降。" 方汉表示,目前异构数据的采集成本已降至每小时 50 元左右,他更进一步预测,从今年到明年,通过视频采集的异构数据成本有望下探至每小时 10 元。
" 当成本降到 10 元一小时,1000 万小时的数据只需 1 亿元人民币。这个成本大家是可以负担的。所以大家一定会用异构数据来 Scaling 我们的具身模型或世界模型,这是最现实的路径。" 方汉说。
除了绝对的成本优势,异构数据在生态多样性与环境复杂度的覆盖上,远远超越了昂贵的真机数据。比如说,黎曼动力机器人在 1.0 模型的训练实践中,团队发现大量异构数据的引入不仅提升了泛化能力,甚至在 " 叠衣服 " 这种传统认为只需 UMI 数据的具体操作上,也带来了极大提升。
三、供应链与人口结构:中国不可复制的具身智能优势
在具身智能与世界模型的赛道上,方汉指认为,宏观战略的天平正在向中国倾斜。这一优势,建立在中国不可复制的工业门类全集与庞大的人口基数之上。
具身数据的本质是物理世界的操作记录。这意味着,任何数据的采集都重度依赖于硬件设备与真实场景的结合。" 中国是所有数据采集设备的硬件主产地,跟中国厂商去卷硬件成本,世界上没有谁能卷得过。" 方汉直言。
正如汽车雷达行业曾经发生过的成本雪崩一样,具身视频采集设备也正在经历类似历程。大量的消费电子大厂正在入局,开发低成本的带运动加速度传感器的双目摄像头,甚至是隐蔽性更好、更便携的采集穿戴设备。
更深层次的护城河在于 " 场景产能 "。
" 中国有全世界最全的工业门类,代表着我们的工业产品最全。同时,我们的服务业非常发达,这就意味着我们能构造出极其丰富的各种操作数据。" 方汉认为,数据最大的产能地一定是不仅具有硬件制造能力,还具有深度场景下潜能力的中国。
四、基础模型护城河与 " 拿着钉子找锤子 " 的应用陷阱
在大模型商业化的探讨中,行业内常有一种声音认为:底层模型格局已定,接下来重心将从模型层全面转向应用层与垂直领域。对此,方汉表达了反对态度。
" 我不太认同这个看法。做应用层也是非常危险的,因为你不知道你的应用能力何时会被大模型的发展所包含并内化掉。"
他以近期热门的 Skills(技能树)为例,指出最新一批文本大模型正是利用了各行各业专家编写的 Skills 进行训练,导致大模型厂商能够轻易获得这些行业最有价值的流程和能力。
对于当前大量创业者试图在垂直行业落地的现状,方汉也指出了产品定义上的逻辑谬误—— " 拿着锤子找钉子 "。很多创业者认为自己的模型能力很强,于是到处寻找行业去赋能,这种做法充满风险。
正确的路径应当是倒推:" 你需要更熟悉一个行业最真实的需求,然后从需求倒过来寻找,什么样的模型或 AI 应用能够满足这个需求。"
五、泛娱乐的降维打击:从短剧平权到游戏模型的算力困局
方汉透露了一个商业现实:" 今年消耗量最大的 API 一定是视频生成。国内某大厂的视频生成收入,已经占了其总收入的一半以上。"
这种爆发背后的逻辑,是门槛的降低带来了创作者规模的指数级扩张。" 视频模型的爆款也许没有当年看电视剧《渴望》万人空巷的高度,但它满足了海量的长尾需求,视频创作者的规模绝对不会低于网文作者。 "
然而,在影视和游戏这两个被寄予厚望的终极娱乐形态上,AI 的渗透步伐却因商业规律和物理法则而产生了分化。
对于 AI 电影,方汉认为技术早已不是障碍,爆款 AI 院线电影和长剧的出现只是时间问题。但对于原生 AI 游戏,他则表示,受制于巨大的推理成本鸿沟(游戏世界模型的推理速度必须比传统 3D 引擎更快),真正的游戏世界模型落地,至少还需要 3 到 5 年的时间。(本文首发于钛媒体 APP,作者|李程程,编辑|杨林)