关于ZAKER Skills 合作
星途科讯 40分钟前

谷歌 DeepMind 发布 Gemini Robotics 2,迈向物理 AGI 新里程碑

谷歌 DeepMind 正式发布 Gemini Robotics 2,该系统通过融合视觉、语言及动作模型,赋予机器人更强大的物理智能。据悉,新模型已能操控包括人形机器人在内的多种设备,执行整理货架、系袋子和更换灯泡等复杂任务。谷歌 DeepMind 机器人业务负责人卡罗琳娜 · 帕拉达(Carolina Parada)称,这是迈向真正 " 物理 AGI" 的关键一步,旨在让机器人具备完成人类各类任务的能力。

多模型协同架构

Gemini Robotics 2 将多种 AI 模型整合为统一系统,通过协同工作实现环境理解与行动决策。其中,视觉语言模型(VLM)负责处理图像与视频信息,进行逻辑推理及人机交互;两个视觉语言动作(VLA)模型则专注于物理空间移动,精准控制机器人的全身运动及机械臂、手部操作。

在演示视频中,Apptronik 公司的 Apollo 2 机器人搭载 Sharpa 机械手,成功自主完成货架整理。值得注意的是,该模型目前仍依赖特定训练数据,包括人类远程操作记录、视频示例及模拟数据,尚不具备在无特定训练下广泛执行复杂任务的通用能力。

强化安全基准

针对安全性,谷歌采用了多层级防护策略,在每个模型层均部署了安全护栏。同时,公司推出了全新基准测试 ASIMOV-Agentic,用于评估 AI 系统在协作控制机器人时的安全表现,重点检测指令是否可能引发有害或不确定后果。

【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】

最新评论

没有更多评论了
星途科讯

星途科讯

解码海外,科技新知

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容