
但在这些看得见的产品背后,一场围绕大脑、数据、灵巧手三大环节的产业链暗战悄然开打,成为决定具身智能能否走出实验室的关键变量。
大脑:从 VLA 到世界模型,谁在构建机器人的 " 思考中枢 "?
本届 WRC 上,《科创板日报》记者观察到一个显著趋势,电机、关节模组、传感器等核心零部件的供应链已趋于成熟,硬件层面的差距正在被快速抹平。当 " 躯壳 " 不再构成壁垒,竞争便自然向上游迁移,今年不少参展商们纷纷亮出模型、算力与泛化能力的新牌。

同期,北京人形正式宣布 Pelican-VL 2.0 商用,其为国内首个网信办备案通过的具身大模型,支持任务规划、意图理解和人机交互。
星海图则走出另一条技术路线,其首席科学家赵行在论坛上拆解了 VLA 模型 G0.5 ——将视觉观测、语言指令和动作全部离散化为 Token,像 GPT 一样逐个输出。
《科创板日报》记者获悉,8 月底星海图将推出 G0.5 模型 Max 版本,该版本届时将全面开源。
" 大家都在期待说具身智能的 ChatGPT 时代什么时候到来,但是我们觉得有一条非常通常的捷径,就是像做 GPT 一样的自回归模型,一个一个 Token 输出训练模型。" 赵行表示。

在其展台最核心的展项是一间 1:1 复刻的智慧药房,《科创板日报》记者在现场看到,观众下单后,机器人便可有序地从货架取下相应的物品。目前,蚂蚁灵波机器人已在上海国大药房正式上岗承担夜班分拣。

从大一统模型到自回归 VLA,从 " 一脑多机 " 到世界模型,具身智能的竞争已从 " 有没有模型 " 升级为 " 模型能不能规模化、能不能泛化 "。
数据:物理 AI 的 " 燃料 " 之争与 " 数据荒漠 " 破局
大语言模型的崛起已充分证明,数据规模决定模型上限。但当同样的逻辑迁移到物理世界时,问题变得棘手起来——机器人需要的数据,远比文字更难采集、更昂贵、噪声也更高。
觅蜂科技方面向《科创板日报》记者表示,主流大语言模型的预训练数据已达 100 万亿 token,等效于 100 亿小时的数据。而物理 AI 需要的数据有效信息密度更低、噪声更高,对数据的需求量更大。

工作人员告诉《科创板日报》记者,目前 MEgo 系列产品已实现量产交付,在工厂、物流、超市、家庭等真实场景采集数据。

光轮智能联合创始人兼总裁杨海波指出,当前具身智能迫切需要高质量、多样性、大规模的数据供给。同时,光轮智能同步推出 5 年 100 亿具身智能数据共建计划。
京东云展台则一比一还原京东 " 两年 1000 万小时高质量数据采集计划 " 中的家政服务场景。《科创板日报》记者在现场可以看到,家政阿姨佩戴着京东云自研的 JoyEgoCam 头戴式数据采集设备,向观众展示人类实操数据是如何采集的。
灵巧手:从 " 能抓取 " 到 " 会干活 " 的最后一厘米
一台机器人即便拥有最聪明的 " 大脑 " 和最敏捷的 " 小脑 ",如果末端执行器连螺丝都捏不稳、连鸡蛋都抓不住,那么所有的感知与决策最终也无法转化为生产力。因此,灵巧手可以说是机器人从 " 能看会走 " 跨越到 " 能干会做 " 的最后一厘米。曾经作为机器人 " 附属配件 " 的灵巧手,也逐渐走向具身智能赛道 C 位。

与此同时,针对大模型训练的数据需求,灵心巧手还展出了 Linker Open TeleDex 数据采集系统。Linker Open TeleDex 集成了支持多种外接设备、多种机械臂、多种灵巧手的开放式硬件系统搭建体系,可同时采集视觉、触觉、本体感知三重模态数据。


工作人员向《科创板日报》记者介绍,Sharpa Wave 的核心创新之一在于视触觉技术路线。与传统压力传感器方案不同,其指尖内壁嵌入 240x240 像素网格,内置微型摄像头通过观察接触形变来感知物体,实现视觉与触觉的双模态融合,从而避免单一感知路径可能带来的判断误差。
从大脑到数据再到灵巧手,本届 WRC 清晰勾勒出具身智能三大核心环节的竞争图谱。当硬件躯壳走向同质化,真正的壁垒正在向上游迁移——模型能否泛化、数据能否规模化、灵巧手能否在真实场景中稳定作业,三者环环相扣,构成了从实验室到生产力的完整闭环。