《科创板日报》7 月 20 日讯(记者 黄心怡)2026 世界人工智能大会(WAIC)特设具身智能展区,汇聚超 200 家企业、300 余台具身机器人,成为本届大会最核心、最热闹的焦点之一。
从现场展示来看,行业正加速迈入以实景应用、实体赋能为核心的落地阶段,场景价值已成为检验技术成色的核心标尺。而机器人 " 触觉 " 与 " 大脑 " 被视为破局关键。其中,触觉被认为是今年乃至明年最具突破潜力的技术维度。
▍从工厂到餐厅,机器人 " 上岗 " 忙
本届展会,人形机器人不再止于展台演示,而是真正被推入真实场景接受压力测试。
进厂打工是最常见的场景。优艾智合在展台搭建微缩产线,五台 " 隙锋 " 人形机器人与移动搬运机器人协同,在线边仓完成物料拣选与配送。
优艾智合联合创始人赵万秋介绍,分级训练框架降低了多机部署门槛,隙锋出厂即具基础动作能力,仅需 50 条数据的小样本训练即可达 90% 任务成功率,运行中以 24 小时为周期持续采集数据循环迭代,实现 " 今天进厂,第二天就是熟练工 "。
微亿智造展示的双臂质检机器人,搭载 0.2 μ m 级检测精度与 1m/s 动态飞拍成像能力,依托多机械臂自主路径规划,彻底摒弃传统人工示教调试流程。据称,该方案已在某头部德系车企国内总装车间及德国本土产线同步运行,成为质检 " 老师傅 "。
睿尔曼智能联合中科慧远展示 CASIVIBOT 工业具身质检机器人,单件检测小于 5 秒,7 × 24 小时稳定作业,产线换型无需重训。据悉,睿尔曼智能的关节模组年产能已突破 50 万台,正向百万级迈进。
商业服务亦是重点方向。睿尔曼全球首发 RealBot-S2 与 L2 两款轮式人形机器人,开幕前两天已在新疆餐厅完成拉条子、穿肉串、烤肉、切菜等真实后厨作业。
矩阵超智 MATRIX-3 化身 AI 咖啡师,自主操作咖啡机、取杯、承接饮品,流程连贯,验证门店与展会接待可行性。
在模拟洗衣房中,擎朗的两台人形机器人在统一调度下自主协同完成洗衣、叠衣闭环操作,技术可延伸至连锁洗衣工厂及家用场景。
卓益得仿生机器人 Moya 则承担了 AI 女性论坛双语迎宾、演播室助理主持及夜间访谈直播任务,并与上海人形机器人中试服务平台签订千台量产协议。
特种场景方面,云深处首款全天候人形机器人 DR02 完成变电站精准作业实地测试,2026 年正式启动商用投放,未来将深耕电力巡检、危化作业、应急救援等场景。
傲鲨将消费级外骨骼机器人 VIATRIX 拓展至户外徒步,已覆盖全国数十个站点,并与多所高校户外社团合作探索。
▍触觉是今明两年具身智能最大突破维度多家产业链企业披露了订单与产能进展。
矩阵超智上海张江基地已实现端到端生产,2026 年规划产能 5000 台,2027 年目标万台,截止目前机器人订单累计约千台,覆盖餐饮、酒店、科研等场景。而蓝思科技子公司与上纬新材签约,首期规划万台级机器人产线合作,聚焦消费级个人机器人量产。
润科具能针对核工业、油田、矿山、应急消防等特殊场景,研发四足、机械臂、半人马机器人、火星车等多种构型,并将消防应急作为半人马机器人的首发落地场景,
在 WAIC 期间与上海华燕消防工程有限公司签约 100 台意向订单,计划第四季度建成小规模产线,国产化率超 95%。润科具能 CEO 周斌强调,触觉是今年乃至明年具身智能的最大突破维度。" 汽车厂装车灯,工人 ‘装上了’的感觉,这不是高清视频能训练出来的。"
触觉可提供物体几何、材质及接触动力学等直接信息,是视觉等远距离传感器无法替代的。公司正推进应用触觉电子皮肤技术,通过柔性传感器阵列采集压力、温度、纹理、滑动等多维信号,让机器人实现从机械执行向自主决策的进化。
本届大会上,灵巧手的触觉感知也成为焦点。千觉展出 VTLA 具身触觉模型、视触觉多模态数据集及穿戴式视触觉数据采集夹爪,直击真实交互数据稀缺、触觉模态缺失的共性难题。
一目科技完成超 10 亿元 E 轮融资,将用于触觉感知材料、芯片、算法与模型研发,并展示五指集成视触觉灵巧手。创始人李智强表示,传统的力传感器无法感知 " 形变 ",机器人 " 看见 " 物体,却不知其硬度与摩擦力,如同人类仅靠 " 看 " 学不会打乒乓球,需要有触觉能力来驱动其完成实操。目前,公司正与斯坦福等合作推进 TouchNet 开源触觉数据集,计划 2026 年底开源更多真实数据。
傲意科技则带来 OpenArm 具身双臂机器人,作为灵巧手的标准化搭载与数据采集平台,通过 " 硬件 + 数据闭环 " 让灵巧手真正走向 " 灵巧 "。
绳肌妙算团队则专注攻关灵巧手的结构寿命、单机成本与批量可部署性等实用目标,正与头部物流企业洽谈仓库分拣应用。
▍机器人大脑:如何跨越数字与物理的鸿沟" 大脑 " 决定具身智能的上限。从 VLA 大模型到端侧算力芯片,从世界模型到数据基础设施,围绕机器人大脑的卡位战全面展开。
极智嘉展示搭载自研 Gravity 4D 具身模型的人形机器人 Gino 1。公司具身智能首席科学家赵昊指出,当前业界常争论 VLA 与 World Action Model 的路线差异。VLA 即第二代多模态大模型(如 Qwen-VL、GPT-4V),通过对图像与语言联合训练的多模态模型进行动作微调。所谓 World Action Model 则属第三代多模态大模型,典型如视频生成模型(以万相、Seedance 为代表)。
赵昊认为,第四、五代多模态大模型已初现端倪。今年 CVPR 两篇 Best Paper 中,一篇指向第四代多模态大模型,是混合训练了视频 Token、文本 Token 与图片 Token;另一篇来自 DeepMind 的 D4RT,实现了 4D Token,预示第五代多模态大模型将会是 4D Token、3D Token、视频、文本与图片 Token 的混合训练。届时在第五代多模态大模型的基础上,以动作数据进行微调,有望迎来具身智能的 "GPT 时刻 "。但目前业界仍主要处于数据积累阶段。
梅卡曼德也在推进具身智能大脑规模化落地,其系统已实现对不同物体、任务及机器人形态的泛化。现场演示中,人形机器人可识别分类数百种物体(文具、水果、蔬菜等),并完成料筐搬运、工件分拣等制造业流水线任务。据介绍,公司这次重点展示 " 眼脑手 " 跨场景应用能力,包括首次亮相的人机协同上下料、货架取货、海量物体分拣、Mech-GPT 多模态交互、透明物体泛化抓取等前沿技术,以及高速小零件上料、线束插头精密装配、多规格工件上料等已在工业场景规模落地的成熟应用。
而爱芯元智推出专用视觉感知芯片 AX8910,为机器人环境感知提供底层算力支撑,已搭载至多家双目相机方案商,适配各类商用与服务机器人。
当大脑仍不够 " 聪明 " 时,一条更务实的路径是机器人自主完成高频重复任务,由人类处理复杂突发情况。当虹科技展示通过手机远程操控 280 多公里外的四足机器人。这只机器狗平时在宁波具身智能产业基地自主巡检,必要时由人类远程接管。当虹科技首席技术官吴奕刚认为,自主智能与远程接管协同,或是物理 AI 可预见的落地形态。
在大会期间的演讲中,蚂蚁灵波科技首席科学家沈宇军将大脑挑战总结为三道鸿沟:一是传感器局限。数字世界的视觉模型擅长识别 " 这是什么 ",机器人还必须知道 " 它在哪里 "" 离我多远 "" 中间能不能通过 "。二是高动态交互,机器人面对的环境随时可能被打断、遮挡或变动,机器人须持续预测并实时修正,无法一次规划到底。三是泛化与产业落地。机器人的能力能力须在不同构型和真实场景迁移,降低重复数据采集与重复训练成本。
他认为,数字世界与物理世界的优化目标不同,识别准、生成美不等于任务完成,模型必还须理解空间约束、遵循因果与物理规律。具身原生之路注定更为艰辛,许多能力需从头构建,但唯有正面解决这些挑战,才能真正跨越数字与物理世界之间的鸿沟。
(科创板日报记者 黄心怡)