
但有一个问题一直在。这个行业的真实水位到底在哪里?模型跑通了 Demo,离进产线干活还有多远?各家大厂的投入,真想入场还是先占个座?
6 月到 7 月,笔者陆续去到北京灵初智能、深圳艾欧智能、苏州乐享科技,加上一场灵生科技的深度交流,以及 WAIC 2026 上具身智能主题的几场圆桌。四家公司的业务从 VLA 大模型训练、远程操控、人形机器人量产到世界模型研发,从基础研究一路延伸到工程化交付。
穿过这些走访,也摸到了几处暗礁,一个更真实的行业轮廓慢慢出来了。
大厂入局
进入四家创业公司的走访之前,有必要先梳理一下大厂在具身智能领域的布局。各家进入的路径差异明显,但放在一起,能大致看清行业当前的几个方向。
最引人注意的一类是自研机器人本体的公司。小米的 CyberOne 从 2022 年亮相至今仍在迭代,延续的是消费电子加智能家居;比亚迪偏向工厂场景,把机器人嵌入自己的产线降本。智元选了一块更难的骨头,其合伙人姚卯青在 WAIC 圆桌上透露,上个月刚在南昌完成了一个六天的产线实操,六万多件产品,成功率做到 99.99%。
越疆科技的创始人刘培超是另一条路线,他在 WAIC 上透露," 手臂现在能做到 10 万小时无故障运行,人形机器人能不能先做到 5 万小时?" 刘培超的判断是,大脑是技术问题,身体是工程问题。越疆不从零造人形机器人,而是从已经很成熟的协作臂出发,逐步往上叠具身大脑。先把可靠性做扎实,智能是下一步的事。
还有一类玩家带着自己的供应链优势入局。博世中国战略副总裁刘敏在圆桌上判断," 去年行业解决了运动性的问题,今年操作性在探索迭代。" 博世把汽车供应链的可靠性标准(16949)带进了机器人领域。不过智元合伙人姚卯青在同一场圆桌上也提醒,今天大多数机器人零部件的可靠性 " 还没有经过充分的时间检验 "。汽车供应链的可靠性标准移植过来有用,但需要时间来验证。
腾讯的打法跟以上三家都不一样。Robotics X 实验室做前沿研究,张正友在 WAIC 上发布了五项新成果,包括端侧 VLA 模型和具身原生智能体框架 Apexio。Tairos 平台走开放路线,核心模型开源,SDK 标准化,跨本体适配。腾讯想做的是具身智能时代的 Android。
这让人想起它在移动互联网时代错失操作系统的经历,只是这一次物理世界的操作系统更依赖云基础设施。商业化落点也顺着这条线展开,腾讯云以 " 数字基座层 " 的身份,为全产业链提供算力、存储、网络和仿真平台。
几种打法同时存在这件事,已经说明具身智能是条需要分层协作的产业链,每一层现在都还有缺口。
灵生科技:世界模型还在 GPT-3 阶段
灵生科技合伙人蒋玉骅做的是世界模型训练。他在交流中提到了一个观点,大致描述出了当前具身智能的技术水位," 具身领域,目前普遍的世界模型大小都在 10B 以下,甚至没有人画出从几十兆到几百亿参数的 Scaling Law 曲线。对比大语言模型,具身智能大概相当于 GPT-3 之前的阶段。"
当外界被各种机器人跳舞、翻跟头的 Demo 包围时,底层模型的成熟度其实远低于预期。蒋玉骅说,灵生走的是一条 " 数据和模型双向驱动 " 的路线,自己有素材工厂保证数据供给,训练模型,模型再反哺数据筛选和质量提升,生成的合成数据又喂回训练管线。
灵生同时在做两种模型,WAM(世界动作模型)负责机器人的决策和动作执行,部署到本体上完成拧螺丝、叠衣服这类任务。AC-WM 做的是数据飞轮的事,对已有数据做质量打分,标出哪些该优先训练、哪些该剔除,同时生成新的合成数据反哺训练。数据来源也分三种,无本体的 EGO 和 UMI 数据、跨本体的机械臂和灵巧手数据,以及本体的真机数据。三种来源放在一起,覆盖面广,数据治理的复杂度也跟着上去了。
这条路最大的卡点是数据基础设施,不是模型架构。蒋玉骅的原话是,"GPU 空转不是因为算力不够,而是 CPU 加载数据跟不上。" 具身智能的数据和 LLM 训练是两回事。LLM 吃的是规整的 JSONL 文本,具身智能面对的是大量碎片化的小文件,视频切片、点云、触觉反馈、动作序列。传统对象存储在读写这类数据时,数据加载是比 GPU 计算更紧的一环。
存储能力因此成了具身智能企业突破工程化瓶颈的一道坎。腾讯云存储产品线负责人陈峥在交流中说,腾讯云存储团队两年前就开始接触具身智能赛道,他的判断是,具身智能未来一到两年的数据量增长会很快。陈峥说,各地省政府包括很多具身客户都在建素材工厂。
为此腾讯云推出了一个叫 Agent Bucket 的方案,本质上是在对象存储之上叠加了一个向量存储和多模态检索层,数据上传时自动做预处理(视频抽帧、VAE 压缩、文本编码),让 GPU 调用数据时不再被 I/O 卡脖子。蒋玉骅的说法是,这套方案 " 帮助克服了 GPU 加载数据的瓶颈 "。
问题是,如果行业还在 GPT-3 阶段,或许还有更重要的问题有待突破。数据策略上,预训练阶段要的是低成本、大规模、高多元性,精度要求不高;后训练阶段才需要高成本精确标注,简单任务 " 几十条上百条就够 "。关于李飞飞 " 世界模型被滥用 " 的说法,蒋玉骅的回应是,具身场景的世界模型要处理从语言指令到动作的映射,而不只是画面预测。
灵生做的事偏底层,离研究更近。下一站的灵初智能更靠近产业,训练的是能在产线上干活的 VLA(Vision-Language-Action)大模型。
灵初智能:VLA 大模型的 " 通信焦虑 "
创始人之一的陈源培解释了灵初从成立第一天就坚持人类数据路线的原因。他表示,互联网数据太脏、真实世界搬不进数采厂、仿真有天然的误差," 看来看去,目前真正能持续 scale 的,还是人类数据。" 所以灵初从一开始选的就是灵巧手,不是夹爪。
路线选定了,但数据量大不等于数据有用。
陈源培透露,10 万小时的人类数据,有时候可能跟 1,000 小时是等效的。如果给数采方下发 1,000 个任务、每个任务采 100 小时,和每个任务采 1 小时,训练效果差不多。" 什么叫高质量数据,这件事现在行业里其实还没有标准答案,我们也还在持续探索。" 数据处理的瓶颈远大于采集。
灵初目前几个数采厂一天能产几千小时数据,下半年全面启动后会到上万小时,但一条数据处理管线跑下来,处理 1 小时数据的用时可能比数据本身的时长还长,算力开销巨大。
这些数据最终要喂给模型训练,灵初的模型训练直接跑在高性能计算集群 HCC 上,底层是星脉网络,最大弹性支持 10 万张 GPU 卡,自研协议栈做拓扑感知流量调度,AllReduce 通信负载率做到 90% 以上,网络故障能做到 1 分钟以内发现、3 分钟定位、5 分钟完成自愈。具身 VLA 模型同时处理视频、文本和动作序列,单次迭代数据量比纯语言模型大得多,通信压力也更大,网络一旦抖动,GPU 就得空转。
不过,跑通训练只是开头。灵初一开始用在市面上买来的整机做落地测试,客户要求节拍做到 400,他们刚开始只有 90。" 感觉能做到 200,但换了自己的整机之后现在已经接近 450 了。" 陈源培说,不是整机厂商做不到,而是一款整机不可能有很多版本,市面上买到的都不完全符合落地需求,只能自己设计了一款 " 小而全 " 的整机,核心零部件代工,产品定义和设计自己做。" 这跟灵初最初‘不做整机、只做灵巧手’的策略确实不一样,但这是我们在实际落地过程中一步一步迭代出来的。"
灵初还有一个做法,把世界模型当成了数据质量的评估器。陈源培的解释是," 我可以用世界模型判断数据到底好不好,能转出机器人执行数据就好,转不出就差。" 这个逻辑反过来驱动了数采员的操作标准和数据处理流程,用模型来判断哪条数据值得训、哪条该扔掉。代价是吃算力,但比人工定规则可靠。
通信短板补上以后,按说可以上更多 GPU、训更大的模型。但现实是,具身 VLA 模型的规模目前普遍卡在 10B 以下,蒋玉骅在交流中就提到过这个行业天花板。当下连模型本身都还不够大,远没到需要担心分布式训练 Scaling Law 的阶段。
堆算力的边际效益没有想象中高,数据质量和数量才是更紧迫的约束。
商业化方面,陈源培的判断分三波,第一波是硬件,不管有用没用,造出来能唱歌跳舞就能卖一笔钱;第二波是数据,现在的数据市场火热,可以做素材服务和数据售卖;第三波才是真正的产品交付。" 终局一定是以产品交付为主。过程中的东西可以适当变现,但长期数据行业一定会趋于平稳,真正起量的是产品落地。" 灵初今年已经签了几个大订单,部分场景的 POC 达到了验收标准。
灵初要解决的是机器人大脑的训练问题,到了深圳的艾欧智能,关注的方向则是机器人有了大脑之后,数据从哪里来,怎么管,怎么用。
艾欧智能:数据基础设施的 " 中间层 "
艾欧智能联合创始人丁哲章给公司的定位是 " 数据基础设施 ",连接本体、模型和场景的中间层。" 今天具身行业本体公司很多、模型公司很多、场景方也很多,但真正把三者串联起来的落地案例还是很少,就是因为中间这一层是缺失的。"
艾欧把数据工具链分成了三套:面向预训练的真实世界人类数据采集系统,面向后训练的 TeleXperience 机器人遥操作数据采集系统,以及面向规模化运营部署的数据回流与管理平台。
远程操控是其中的关键技术,艾欧在 2025 年 WBCD 挑战赛上实现了 " 人在深圳、机器人在美国 " 的跨境遥操作,拿下了最佳应用奖。TRRO 方案在局域网内端到端延迟小于 30 毫秒,跨域公网小于 100 毫秒,大致是人眨一次眼的时间。远程操控如果延迟超过这个阈值,操作者看到画面再做出反应时,机器人可能已经撞上了工件。100 毫秒是远程操控能不能从 Demo 走进产线的一道物理门槛。
但丁哲章对行业节奏的判断,比技术参数更能说明问题。他把具身智能过去几年的进展分了几个阶段,2022 年前后是 PPT 阶段,2023 年把本体做出来放那儿还不能动,2024 年将将能动起来、具备运动等基础能力,去年开始进入部分场景、展示部分自主能力。至于今年能不能看到 " 在更多场景中展示更强的能力 ",他对此存疑。
" 现在有个比较明显的断层,场景方对具身机器人的预期,和本体、模型现在真正能做到的程度之间,是有差距的。" 丁哲章说,今年聊落地这件事的需求数量确实变多了,但落地案例有没有同步变多," 这件事要打个问号 "。他举了自动驾驶的类比,2016 年行业宣称 2025 年做到 L5 全自动驾驶,十年过去,今天只是 " 差不多可用 "。具身也会经历同样的过程,高预期先来,然后调整,然后慢慢贴近现实。
艾欧的策略是 " 渐进式落地 ",让机器人先做 20% 到 40%,人用遥操作补剩下的,先运转起来再迭代。丁哲章说,他们一直在和场景方同步一个理念," 现在的机器可能没有你想象的那么聪明,你需要接受这种中间状态。"
除了遥操数据,人类数据稀缺的格局也在变。丁哲章透露,早期不管什么数据都要采,连抓一张纸巾的动作都缺数据。现在基础能力有了填补,但一旦要渗透到具体场景,比如让机器人做按摩、去加油站加油,专有任务的数据极端稀缺。目前需求量最大的两类数据,一是灵巧手长程精细操作,因为灵巧手硬件最近才有了能用起来的迭代;二是机器人全身运动,此前只有运控层面的走和跑,全身协调做任务的模型半年多前才开始出现。
艾欧的人类数据采集设备在两年间还有一个变化,即越来越简单了。2024 年的版本还有触觉手套和惯性陀螺,到 2026 年变成了 Ego+UMI 组合的轻量化方案。丁哲章的解释是," 一旦设备变复杂,采集的一致性和效率就降低了。在大家对数据量有明确需求的今天,复杂方案就没有被选择。"
量产关的三座大山
前面三家公司,灵生做世界模型,灵初做 VLA 大模型,艾欧做数据基础设施,关心的都是模型和数据怎么落地。到了苏州的乐享科技,问题是模型和数据都有了之后,机器人能不能造出来,造出来能不能上产线。
乐享科技正在度过人形机器人的量产爬坡期,跟联席 CTO 李元庆聊过之后,量产面临的第一道坎是算力。
在全球算力流通不确定的背景下,李元庆的感受是,RTX 6000 国内拿不到,5090、4090 的平替还在测试,国产卡海光、昇腾逐步可用,但迁移有成本。他坦言," 能用的卡价格极贵,这就是现实 "。
算力短缺的压力已经不小,但李元庆发现另一个问题更难处理,模型规模在推着算力需求往上跳。李元庆提到,团队过去一直压着 2.5B 的端侧模型做训练," 但后来发现想要上一些高成功率的动作,比如插 USB,模型参数量低于 20B、低于 30B 就没有什么作用了 "。一个 30B 和一个 2.5B 的模型,算力需求差了一个数量级,只能从端侧搬到云端。元点 Zeroth 后来也上了星脉网络的 HCC 集群,但在李元庆看来,底座再好,上游算力供应的不确定性始终是最紧的一环。
元点 Zeroth 的策略是硬件全栈自研来降本,等供应链成熟了再上新的工艺,一些环节分给合作伙伴,把隐性成本摊出去。
元点 Zeroth 在苏州碰到的这些问题,WAIC 圆桌上的几位嘉宾也各自遇到了。姚卯青(智元)、刘培超(越疆)、刘敏(博世)、张正友在讨论中,把人形机器人量产拆成了更具体的工程问题。
姚卯青讲述了智元进入南昌产线的过程,先实验室测到 99%,再上副产线调参,最后上主产线压测,一个月通宵调试才做到四个九。" 限速问题、芯片焊接缺陷、减速器故障……你能想象到的问题都会出现。"99% 到 99.99% 的差距,靠的是硬件、通信、调度、诊断的全栈工程能力,不是模型本身。
张正友在演讲中透露,腾讯 Robotics X 的 VLA 模型已经在日化品工厂开始试运行,产线要求成功率高于 95%、节拍快于 6 秒一个动作、新增 SKU 数据采集和后训练时间不到三天。这些指标在实验室里不算什么,进入三班倒的真实产线,意义完全不同。
硬件端的挑战也不小。刘培超在圆桌上说,越疆的机械臂做到 10 万小时无故障运行,但人形机器人动辄 20 个关节起," 能不能先做到 5 万小时起,再突破 10 万,是一个循序渐进的过程 "。博世的刘敏则提醒了节拍这个维度,替代工人的工位不光要能完成动作,还要 " 快 "。6 秒是一个相对门槛,不同场景要求不同,但整体逻辑是 " 从场景当中由易到难,有一些容忍度,再一步步提高模型和小脑的能力 "。
四家公司走下来,加上 WAIC 圆桌上的讨论,2026 年上半年具身智能行业的水位到底在哪里,大致能看出来了。
模型、数据、硬件、落地都在往前走,但每一项都比外界从 Demo 里感受到的慢。模型还在找路线共识,数据基础设施在加速成型,碎片化的工程难题还在有一个个攻破的路上。硬件可靠性的爬坡以年为单位,产线落地已经有真实案例了,但离开箱即用还有一段距离。
丁哲章对 " 预期断层 " 的描述是,聊落地的需求变多了,落地案例没同步变多,几个走访企业对此也都有同感。陈源培的三波商业化判断,硬件先卖、数据跟上、最后才是真正的产品交付,行业离规模化交付还有一段路。
或许真如博世刘敏在圆桌讨论中说的那样:" 这是一条路,一步步往前走。"
2026 上半年的推进速度超过了此前两年的总和。不是哪个单项突破了,模型、数据、通信、硬件在同步向前。但真正走进产线才会意识到,跟 Demo 里的画面不同,这个行业的进度条,是工厂夜班里一轮一轮磨出来的。(本文首发钛媒体 APP,作者 | AGI-Signal,编辑 | 秦聪慧)