关于ZAKER Skills 合作
钛媒体 24分钟前

造得出一万台机器人,却喂不饱一个大脑

文 | 公爵互联社,作者 | 牛金鹏

这个夏天,人形机器人行业的新闻是一条比一条炸。

天骄队在机器人运动会上百米跑了 8 秒 64,比博尔特的世界纪录还快将近一秒;天卓队 1500 米 2 分 21 秒 64,人类 3 分 26 秒的纪录被直接甩在身后。智元机器人第 1.5 万台通用具身机器人 6 月正式下线,距离第 1 万台下线还不到三个月。小鹏机器人首轮融资超 9 亿美元,投后估值 63 亿美元。软银更狠,被曝出拟 60 亿美元收购 1X Technologies 多数股权。

身体越来越强,价格越来越低,产量却越拉越大。但你要是跟做机器人算法的工程师聊一聊,他们多半会叹口气:硬件现在真不缺了,缺的是数据。

这话听着反直觉——都万台量产了,还缺数据?缺。而且缺得厉害。

大语言模型能从 GPT 1 迭代到 GPT 5.6,靠的是互联网上免费的文本数据,网页、书籍、论文、代码,爬下来就能用。但机器人要的不是文字,是物理世界的真实交互——伸手抓一个杯子该用多大力,踩到一滩水的重心怎么调,一个没见过的工具怎么上手。这些数据,互联网上一条都没有。

每一条都得让机器人在真实世界里亲手做一遍。贵,慢,还容易坏。

行业现在集体撞上一堵墙:身体已经进量产时代了,大脑还在等米下锅。

大模型喝自来水,机器人喝瓶装水

机器人的数据饥荒,不是 " 数据不够多 " 那么简单,是它从根上就和大模型不是一回事。

训练大语言模型,数据从哪来?全网爬。Common Crawl 一个公开数据集就有超过 2500 亿个 token 的网页文本,维基百科、GitHub、百万册图书,全部免费下载。大厂之间拼的不是数据有没有,是谁清洗得更干净、优质数据比例更高。数据是自来水,拧开龙头就有。

机器人完全是另一套逻辑。

你想让它学会抓杯子,给它看一万张杯子的照片没用。照片只告诉它杯子长什么样,不告诉它抓的时候手指怎么弯、用多大劲、杯子滑了怎么补。这些信息,只有让机械手真的伸出去、碰到杯子、感受到阻力、完成抓取,才能产生一条有效数据。

一条数据,等于一次真实的物理操作。

操作一次多久?简单抓取从感知到执行大概几秒钟。但要覆盖不同形状、不同材质、不同位置、不同光照下的抓取,学术界的估计是百万级到千万级的真实交互。

一千万次抓取是什么概念?一台机器人 24 小时不停,一次 10 秒,一天 8640 次,抓满一千万次要将近 1200 天,三年多。这还只是抓杯子一个动作。

而且机器人不是手机,它会坏。关节电机有寿命,减速器会磨损,机械臂高频操作容易出故障。一台机器高强度跑数据,几个月可能就得修一次,修的时候就是零产出。

大模型的数据是数字拷贝,边际成本几乎为零;机器人的数据是物理消耗,每一条都要花钱花时间。一个自来水,一个瓶装水还得自己灌装——这就是为什么大模型两年迭代三代,机器人的通用操作能力十年了还在实验室打转。

有个对比很说明问题。2023 年 10 月,谷歌 DeepMind 联合全球 21 家机构、34 个学术实验室,攒出了目前全球最大的开源真实机器人数据集 Open X Embodiment,总共 100 多万条轨迹,覆盖 22 种机器人、500 多种技能。听着很多对吧?但分散到 500 多种技能上,平均每种技能不到 2000 条轨迹。而大模型那边,光是一个 Common Crawl 就是 2500 亿级别的 token。两个量级差了不止一百万倍。

WRC 2026 同期举办的具身智能专题论坛上,好几位技术负责人在公开讨论里说了类似的话:现在算力不缺,算法框架也不缺,缺的是足够多、足够好、足够多样的真实物理交互数据。

仿真救不了场

真机采集又贵又慢,那用模拟器行不行?在电脑里建个虚拟世界,机器人在里面练,练好了搬到真实世界——行业管这个叫 sim2real。

想法挺好,现实却很骨感。

模拟器里的世界是程序员写出来的。一个杯子多重、摩擦力多少、表面粗糙度,全靠人工设。你设 200 克,真实杯子可能 180 克也可能 250 克;你设摩擦系数 0.4,杯子沾了油可能就变成 0.2。差一点,结果就差了很多。

最难的是接触。机械手碰到物体那一瞬间,形变、摩擦、滑动、反作用力,这些在模拟器里很难算准。学术界有个词叫 " 接触丰富操作 ",意思就是只要涉及接触,仿真就容易翻车。

结果就是:模拟器里练一千万次,成功率 99%,搬到真机上一上手,成功率可能直接掉到 30%。模拟器里的杯子和真实的杯子,根本不是同一个东西。

其实行业里不是没有努力。英伟达的 Isaac Sim、微软的 Mujoco、谷歌的 DeepMind Control Suite,都是顶级仿真的平台。各家也在做 " 域随机化 " ——模拟器里把物体颜色、形状、重量、摩擦系数随机变,让机器人见过各种杯子,指望到真实世界能泛化。

但域随机化解决的是 " 见过很多种 ",解决不了 " 真实世界有一种你没见过的 "。真实世界的多样性是无限的,模拟器再怎么随机也是有限的。这个鸿沟,目前没有哪家公司能填上。

WRC 上有个细节很说明问题。不少展台的机器人演示分拣、叠衣服、操作工具,看着行云流水。但你凑近了看,物品位置是固定的,光照是调好的,连物品本身都是挑过的标准件。你把东西挪个位置、换个牌子,或者让观众随便放一个上去,成功率就有可能立刻断崖式的掉。

不是工程师不想做随机测试,是随机测试一上就翻车。翻来翻去,原因还是数据不够——没在足够多变化的真实场景里练过,遇到没见过的就懵。

仿真能用来预训练、能验证算法,但替代不了真实数据。就像你在驾校模拟器里开了一万小时,真上路该紧张还是紧张,模拟器里没有真实的马路杀手。

一个死循环

数据饥荒最让人头疼的地方,不是难,是它绕成了一个圈。

想让机器人变聪明,需要大量真实场景的数据。想拿到真实场景的数据,得让机器人先进到真实场景里跑。想让它进真实场景,它得先足够聪明、能稳定干活、不闯祸。但它不够聪明,是因为还没有足够的数据。

要数据,要场景,要智能,要数据。转一圈回来了。

大模型从来没有遇到过这个问题。它爬数据的时候不需要先证明自己能写文章,互联网数据是开放的、免费的、谁都能拿。

机器人却不行。工厂不会让一台还不稳定的机器人上产线的,万一撞坏设备、伤了人、耽误生产,谁担这个责任?家庭更不会买一台经常犯错的机器人,打碎个陶瓷有可能比机器本身还贵重。

真实场景是有门槛的。你不够好就进不去,进不去就拿不到数据,拿不到数据就永远不够好。

所以现在大部分公司的数据还停留在实验室采集中,自己实验室搭几个标准场景,机器人反复操作攒数据。但实验室场景是有限的、标准化的,跟真实世界的多样性比就是九牛一毛。

也有人试过遥控操作:人戴 VR 设备远程操控机器人,人怎么做机器跟着做,同时记录数据。这样采集速度比机器人自主学习快,质量也高,毕竟是人类专家在操作。

但遥控操作也有一个问题。贵,熟练操作员时薪不低还得培训;慢,一个人一次只能操控一台;数据多样性还是受限,操作员的动作就那么多,真实场景的变化是无限的。更关键的是,遥控操作采的是 " 人怎么操作 ",不是 " 机器人怎么自主操作 "。机器人最终得学会自己决策自己执行,不能永远跟着人类学。遥控操作能做冷启动,解决不了规模化。

至少在公开信息里,还没有哪一家公司宣布跑通了 " 低成本、规模化、高质量获取真实物理数据 " 的闭环。大家都在圈里打转,谁先跳出来,谁就拿到下一个时代的入场券。

几条路,都还没跑通

死循环摆在这,行业不可能干等着。目前能看到几条思路,但每一条都还早。

最直接的是重资产堆量——要么把机器人铺到真实场景里边干活边攒,要么自己建个 " 数据工厂 ",几百台机器 24 小时专门采集数据。前者受限于场景门槛,客户不让不稳定的机器进场,通常只能先从仓储分拣这种半标准化场景切入;后者成本极高,而且 " 人造的真实 " 和 " 真实的真实 " 永远有差距,你在工厂里练了一万种抓杯子,客户厂里那个杯子可能还是第一万零一种。一万台机器人听起来很多,分散到无数场景和任务里,每个场景分到的还是不够。

另一条路是跨机构共享数据,谷歌的 Open X Embodiment 就是这个思路——三十多个学术实验室把各自的数据凑在一起,100 多万条轨迹开源给全行业用。但问题也很明显:贡献者主要是高校和研究所,商业公司很少愿意把核心数据拿出来共享;而且 22 种机器人硬件不同、传感器不同、接口不同,数据格式不统一,用起来要做大量的适配。开源数据集能降低入门门槛,但解决不了商业公司的核心数据需求。

还有人想用大模型生成合成数据,真实数据不够,让大模型根据文字描述生成一段机器人操作的视频轨迹拿来训练。听着有想象力,但目前还很早期。大模型生成的虚拟操作和真实物理操作之间同样有鸿沟,而且大模型本身就没怎么见过真实物理交互,它脑补出来的东西可能从根上就不对。

几条路,没有一条被验证跑通。所有人都知道数据是瓶颈,但没有人找到低成本规模化解决的办法。

身体在军备竞赛,大脑在闹饥荒

回到开头那个热闹的今天。

百米 8 秒 64、1.5 万台下线、9 亿美元融资、60 亿美元收购,这些新闻读着让人觉得人形机器人马上就要爆发了。但你把视线从身体移到大脑,会发现另一个更安静也更严峻的现实:运动能力一年一个台阶,通用智能的进步速度远没有看起来那么快。

原因不在算法,在数据。

VLA 模型、世界模型、强化学习,这些框架这两年进步确实大。但算法是菜谱,数据是食材,菜谱再精美没有食材也做不出菜。现在菜谱更新到第三版了,食材还在等米下锅。

这就造成一个很拧巴的局面:行业都在卷身体——关节数量、运动速度、负载能力、量产规模,因为这些看得见摸得着、好量化好宣传。数据这种看不见摸不着、短期出不了成绩的,反而投入不足。

但决定机器人能不能真正上班的,不是它跑多快,是它能不能在一个没见过的场景里自己想办法把活干了。这个能力,主要靠数据喂出来。

所以评估一家机器人公司,别只看本体参数和量产计划,该问的是:你们现在有多少小时真实交互的数据?采集成本和速度是多少?数据闭环跑通了吗?这三个问题的答案,比自由度和百米速度更能决定这家公司三年后值不值钱。

不是头部玩家就别卷身体了,供应链已经非常成熟,卷不过宇树,也卷不过那些有大厂背书、能砸钱铺量的玩家。找个垂直场景扎进去,把这个场景的数据吃干榨净,可能更聪明。通用数据大家都缺,但垂直场景的数据是可以靠深耕攒出来的。一个只做电力巡检的机器人,在电力场景的数据量可能比所有通用机器人公司加起来都多,这就是壁垒。

往大了说,数据饥荒不是某一家的事,是基础设施的问题。大模型时代有开源数据集、有数据标注的产业,机器人时代也需要一套物理数据基础设施——标准化的格式、共享平台、低成本采集方案。谁能把这套建起来,谁就不只是一家机器人公司,而是整个行业的水电煤供应商。

结束语

2026 年,人形机器人的身体已经足够强壮了。

能跑赢博尔特,能跳过高台,能后空翻,能拧螺丝能端茶倒水。但你把它放到一个没见过的房间里,给它一个没见过的工具,让它做一件没练过的事——它大概率还是会愣住,或者犯错。

因为它的大脑,还没见过足够多的世界。

造身体的问题,供应链解决了。造大脑的问题,算法框架也基本清晰了。现在卡脖子的是最朴素也最难的一件事:让机器人在真实世界里,亲手做足够多的事,见足够多的场面。

这是成本问题、规模问题、商业逻辑问题,也是接下来三到五年行业最需要啃的硬骨头。

身体的军备竞赛大家都看得见,大脑的粮食危机才刚刚开始。

谁先解决数据问题,谁才真正拥有了机器人的大脑。在那之前,所有号称 " 通用 " 的人形机器人,都还只是身体强壮、但没怎么见过世面的孩子。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容