关于ZAKER Skills 合作
智东西 2小时前

智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂

智东西

作者 | 江宇

编辑 | 漠影

当一台机器人站在多人交谈的展厅里,它能不能从嘈杂声中听出谁在和自己说话,判断一句话是否需要回应;能不能在对方停顿时接过话头,被突然打断后自然续上;还能不能一边回答,一边配合语气做出恰当的手势和表情?

这些看似寻常的交流细节,是具身智能的核心能力,也是机器人跨越自然交互门槛时最难补齐的一环。

长久以来,机器人行业困在一个尴尬的悖论里:单项能力不断突破,把 "看、听、说、动" 揉成一个连贯的、像人一样的整体,始终差着一口气。

这道鸿沟的本质,是交互能力跟不上——感知、推理、语音、动作各跑各的,始终没有在同一个时间轴上协同起来。

近日,智元自研的全模态大模型 WITA-Omni Preview 给出了一份有分量的答卷。

在行业公认的具身全模态理解权威榜单 DailyOmni 上,它以 85.21 分的综合成绩登顶榜首,超越千问、Gemini、豆包、英伟达等国内外领先模型,八项细分指标中六项拿下第一。

在 " 看懂环境、听懂声音、边听边想、边说边动 " 这条核心交互能力主线上,一家专注具身智能的企业,跑到了通用大模型厂商的前面。

此前,智元自研世界模型 Genie Envisioner-Sim 2.0 已在 WorldArena" 世界模型感知与动作响应 " 赛道拿下总分第一。此次 WITA-Omni 又在全模态理解榜单登顶,两项成绩分别对应机器人理解物理世界、模拟物理世界以及与物理世界交互的关键能力。

这也让外界观察到,智元在造机器人本体之外,正同步构建出 " 交互 - 作业 - 运动 " 三位一体的自研 AI 版图。

一、一场 " 声画对位 " 的大考:DailyOmni 凭什么检验真正的全模态能力

" 能看图 + 能听声 " 的简单加法,不等于全模态。真正的难点在于,声音和画面同时涌来时,模型能否分清谁在说话、什么事先发生、该关注哪个细节。其核心是边听边看边想的同步协同能力。

DailyOmni 的评测逻辑恰好对准了这个难点。

它大量采用真实开放环境音视频,考察声画对应关系、事件时序判断、跨模态联合推理,检验模型能否 " 听到声音就知道画面里谁在说话 "" 看到动作就知道事情发生的先后顺序 ",在连续的时间流里理解一段真实物理世界正在发生什么。

与仅靠单一画面或语言先验就能完成的图文评测不同,DailyOmni 中大量问题要求模型同时调动声音和视觉信息,缺一不可。

WITA-Omni 交出的成绩单:综合 85.21 分登顶,音视频对齐 86.13、事件时序 84.64、综合推理 85.06,并在比较理解及 30 秒 /60 秒视频理解等长时序任务上取得领先。八项指标中六项第一,在 " 声画对齐、时序判断、跨模态推理 " 整条主线上建立了系统性的领先。

再看同台竞技的参照系。站在 DailyOmni 榜单上的,是千问、Gemini、豆包、英伟达等通用大模型厂商的商用或旗舰模型,智元是其中少有的 " 具身智能赛道选手 "。

一家以机器人起家的公司,在全模态理解上跑赢了大模型大厂。分数的胜负之外,这份排名更指向技术路线的选择:从机器人原生交互场景出发构建全模态能力,正在证明自身的竞争力。

WITA-Omni 用排名第一证明,让机器人 " 自然流畅地理解并回应世界 ",智元已经走在了前面。对行业而言,这也是一次认知校准:过去市场看智元,更多看到的是机器人整机和量产能力;而这次登顶说明,智元的 AI 大模型能力,已进入与大厂同台竞技的第一梯队。

二、Thinker – Talker – Actor:让机器人边想边说边动

传统机器人交互像一条流水线:先识别语音、再理解语义、再生成回复、再合成语音、最后输出动作。每一步都有延迟,每换一棒都有损耗,结果就是机器人 " 想完再说、说完再动 ",做不到人那样边想边表达的自然感。

这种级联架构存在三重天然缺陷

其一,多模块串行调用导致响应延迟不断累积,一段对话下来迟钝感越来越明显。

其二,信息跨模块转换产生语义损失,上一环的理解传到下一环时已经打了折扣。

其三,语音、动作和表情独立生成,无法保持节奏与情绪同步:嘴在笑、手却没跟上,或者话说完了、表情才姗姗来迟。

最终,机器人可能每个模块都能工作,却始终不像一个协调、完整的智能体。

WITA-Omni 的原生架构从根上打破了这个串行范式。

它在 Thinker – Talker 范式上扩展出 Actor 模块,将机器人动作和表情提升为与语音并列的一级输出

Thinker 是多模态推理核心,把文本、图像、音频、音视频经各自编码器与轻量投影层映射到统一表示空间,做跨模态联合推理和高层交互决策;Talker 以 Thinker 的隐状态为条件,流式生成自然语音;Actor 由动作头与表情头组成,驱动动作与表情

三个模块在统一的时间轴上同步推进,替代了传统 " 处理完一个再交给下一个 " 的串行模式。

跨流同步机制的设计进一步强化了这种同步性。Actor 不仅接收 Thinker 的语义状态,还以 Talker 的音频隐变量为条件,使动作能够感知语速、停顿、重音和情绪变化。

机器人的手势和表情从语音生成的过程中实时响应:边说边动、边动边表达,语音、动作和表情在同一条时间线上,理解与回应同步完成。

WITA-Omni 架构的核心突破在于 " 原生 " 二字,它把 " 理解 " 和 " 表达 " 从两个步骤变成了同一个生成过程的不同维度。

通用大模型厂商的全模态模型,大多优先适配线上数字内容交互;而智元从机器人原生交互需求出发,重新定义了全模态模型的结构。这既是一个工程架构的创新,也体现了具身智能公司独特视角带来的差异化竞争力。

三、千万小时中训练 + 千小时高质量后训练:具身数据的 " 炼钢术 "

基座模型的竞争正在跳出 " 谁的参数量大 " 这个维度,而具身智能的数据难题更难:公开音视频数据没有交互轮次、没有响应时机、没有动作和表情的时序标注。拿这些数据训出来的模型,永远学不会 " 什么时候该说话、什么时候该动 "。

WITA-Omni 的领先来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。

在中训练阶段,WITA-Omni 使用了千万小时级多模态数据,将强文本、视觉底座升级为能够 " 听得见、看得懂,并进行音画联合推理 " 的全模态模型。

数据配比经过精心设计。音视频联合数据约占四成,重点训练声音、画面与事件之间的对应关系;纯音频数据约占三成,用于强化语音、声学事件和环境声音理解;视觉与文本数据分别约占两成和一成,用于保持原有视觉与语言能力。

这一阶段聚焦三个问题——声音来自哪个主体、对应哪个视觉事件,不同事件发生的先后顺序与时间关系,以及必须同时结合声音和画面才能完成的跨模态推理。数据配置的逻辑始终围绕具身交互的核心能力需求,而非单纯堆量。

公开数据远远不够。为此,智元自建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留了声音、画面、语言、动作和表情之间天然的时序关系。

数据主要来自三类场景:

带有同步语音、动作和面部表情的人 - 人及人 - 机交互视频,并标注轮次切换与响应时机;

机器人在遥操作交互过程中由自身传感器采集的第一人称感知与动作数据;

通过半自动数据流水线,将原始视频转化为带有说话人、动作、事件、时间区间、指令和问答标注的监督样本。

这套数据让模型直接从真实交互中学习 " 什么时候说、对谁说、如何配合动作 ",跳过了多模块人工规则拼接的环节。

在千小时级高质量数据上,WITA-Omni 进一步采用 SFT – OPD – RL 三阶段后训练策略

SFT 监督微调建立基础的全模态理解、交互决策和多流生成能力。

OPD 同策略蒸馏让同一个模型同时扮演 " 老师 " 和 " 学生 ",老师模型在获得额外时间区间、目标对象等特权信息后生成高质量答案,再将能力蒸馏回不依赖特权信息的学生模型,在保持模型自身表达风格的同时提升音视频上下文中的推理能力。

RL 强化学习重点优化 Thinker 的交互决策能力,奖励信号覆盖可验证答案、时间区间匹配、目标人物选择、等待或回应决策,以及主动触发准确率,并通过 GRPO 优化模型策略。

由此,模型不仅学会 " 回答正确 ",还进一步学会在真实场景中判断该不该回应、何时回应、回应谁。

围绕具身交互这一核心场景,在数据采集和训练策略两个层面,智元构建了一套完整的体系化能力。最终,WITA-Omni 将音视频联合理解、交互决策与同步表达融为一体,让机器人不仅 " 看得懂、听得懂 ",更能回应得自然,这也是其在具身交互场景中的核心竞争力。

四、不仅要 " 想得准确 ",更要 " 聊天像个人 "

理解准确只是及格线,交互智能的更高标准藏细节处:你说话时它会不会乱插嘴、你停顿时它能不能安静思考、你打断时它能不能自然切回来。这些细节,决定了人和机器人能不能真正 " 聊得来 "。

WITA-Omni 在语音交互侧同样经受住了检验。

在国际权威第三方大模型评测 Artificial Analysis 的 Speech Arena 所采用的两个公开基准上,智元做了同协议评测:衡量语音推理的 Big Bench Audio,与衡量全双工对话能力的 Full Duplex Bench 子集(覆盖停顿处理、轮次切换、打断处理、附和处理)。

衡量语音推理的 Big Bench Audio

衡量全双工对话能力的 Full Duplex Bench 子集

WITA-Omni Preview 在这两项上均取得第一,超越了 GPT-Realtime 等闭源商用模型。

全双工对话,即同时听和说、实时判断语轮切换,是语音交互中难度极高的环节,WITA-Omni 在这项能力上的领先,意味着它能在真实对话节奏中做出自然反应:该说时说、该停时停、被打断能自然衔接、听到附和不乱节奏。

很多模型在离线评测中能答对问题,一进入真实对话场景就暴露短板:该停的时候不停、该说的时候犹豫、被打断后就断片。WITA-Omni 在动态对话指标上的领先,说明 " 交互节奏对 " 和 " 理解能力强 " 同等重要,甚至更难做到。

这种节奏感,是机器人进入家庭、工厂、服务场景时用户直接感受到的体验。用户不会关心模型参数量,只会直接感受到 " 这个机器人说话像不像个人 "。

WITA-Omni 的能力覆盖了 "感知—推理—表达—交互" 一整条链路。这种全链路能力,划出了它与通用大模型 " 单模态强、交互弱 " 之间的关键分野。

通用大模型厂商的全模态模型,更多面向内容消费场景;而 WITA-Omni 从设计之初就以真实物理交互为目标,在交互节奏这个维度上建立了天然优势。看懂听懂决定下限,聊得顺、动得自然决定上限,WITA-Omni 在语音交互侧的领先,补齐了具身智能在 " 自然表达 " 这个维度上的关键一环。

结语:三智一体,领跑行业

长久以来,智元一直围绕作业智能、交互智能、运动智能 " 三智一体 " 打造差异化竞争力。

在智元的 " 一体三智 " 架构中,运动智能是基础智能,是物理载体的执行器;作业智能提供劳动生产力,让机器人自主干活;交互智能提供服务生产力,让机器人自然交流。

此前,智元已在 WorldArena 具身智能综合评测中拿下总分第一,作业智能的 GO 系列基础模型、运动智能的运控基座模型均已建立行业领先优势。交互智能的全球登顶,让行业看到了智元三智一体的完整能力版图。

三智齐备的意义,在 2026 年尤为清晰。今年,具身智能行业迎来开发态向部署态的关键跨越——机器人走进产线、门店和家庭,创造真实生产力。部署态的核心门槛,是三个智能的协同:运动智能决定能否走进场景,作业智能决定能否完成劳动,交互智能决定能否给人提供情绪价值,产生服务生产力。智元在行业率先推出的七大生产力解决方案中,三智一体的完整能力栈是其底层支撑。

当机器人逐渐进入工厂、商业服务和公共空间,衡量智能水平的标准,将超越单项指标,走向整体协同。WITA-Omni 此次登顶,让机器人距离真实世界的自然交互更近了一步,也让智元 " 既有本体、更有 AI" 的定位落地为可验证的能力闭环。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容