关于ZAKER Skills GEO服务 合作
智东西 1小时前

直播“烧钱”后,罗福莉终于放出新模型,实测 MiMo-V2.6 系列:给小米汽车换个官网

智东西

作者 | 毕伟豪

编辑|李水青

智东西 9 月 22 日报道,今早,小米大模型团队发布并开源了新一代模型 Xiaomi MiMo-V2.6 系列,包含两款原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,小米还将逐步开放 MiMo-V2.6-Pro-UltraSpeed,相比 MiMo-V2.6-Pro,同等智力水平输出速度提高 20 倍

Xiaomi MiMo-V2.6 系列模型官宣(来源:X)

此外,小米还同步开源了用于新模型训练的 RL 环境和框架以及模型技术报告

Xiaomi MiMo-V2.6 系列模型训练框架(来源:Huggingface)

罗福莉早上发文称,MiMo-V2.6 押注大规模 RL 扩展,进行了开源模型迄今最大规模的单次 RL 训练,团队将其视为探索 RSI(递归自我改进)、通往 AGI的新一步,她直言 MiMo-V2.6 的创新和工程难度已经超过了 DeepSeek R1。

罗福莉发文(来源:X)

MiMo-V2.6-Pro在 Artificial Analysis 智能指数上取得 46.32 分,超过 Kimi K3 与 Qwen3.8 Max,成为该榜单迄今得分最高的开源模型,不过从得分上看总体与顶尖开源模型差距不大,其得分与刚刚发布的 Grok 4.7 相当

MiMo-V2.6-Pro 在 Artificial Analysis 智能指数排名(来源:Artificial Analysis)

在主要测试 AI 网页开发能力的 Code Arena WebDev 榜单中,MiMo-V2.6-Pro 首测拿下 1628 分,较上一代 MiMo-V2.5-Pro 的 1475 分大涨 153 分,目前排名全球前十、开源权重模型第三。

MiMo-V2.6-Pro 在 Code Arena WebDev 榜单排名(来源:Arena AI)

价格方面,MiMo-V2.6 系列维持 V2.5 系列的 API 定价,MiMo-V2.6-Pro 输入(缓存命中)0.025 元 / 百万 tokens,缓存未命中 3 元 / 百万 tokens,输出 6 元 / 百万 tokens;MiMo-V2.6-Flash 输入(缓存命中)0.02 元 / 百万 tokens,缓存未命中 1 元 / 百万 tokens,输出 2 元 / 百万 tokens;MiMo-V2.6-Pro-UltraSpeed 定价是 MiMo-V2.6-Pro 的十倍

MiMo-V2.6 系列模型定价(来源:小米)

有网友晒出 MiMo-V2.6-Pro 与 Grok 4.7 的价格对比,同等智力水平下,Grok 4.7 的价格大约是 MiMo-V2.6-Pro 的 29 倍

网友评论(来源:X)

Xiaomi MiMo-V2.6 系列发布的预热方式也非常有趣,9 月 17 日凌晨,罗福莉在社交媒体上发布了两款模型的训练数据实时看板,全网 " 直播 " 了小米 MiMo-V2.6 的训练细节,两轮训练平均每小时烧掉了 3.08w 美元。

罗福莉发文直播训练过程(来源:X)

有网友评论称这是有史以来最酷的开源发布之一,不仅直播训练过程,还开源了技术细节,性能超强的同时,定价低到离谱。

网友评论(来源:X)

不过也有开发者对模型能力提出了质疑,认为 MiMo-V2.6 系列至少 Flash 模型没有达到预期,在 OpenCode 中会不断循环执行命令和读取文件,执行能力较差。

网友评论(来源:X)

智东西第一时间在 OpenCode 中对 MiMo-V2.6 系列模型进行了实测,从实际效果上看,MiMo-V2.6 系列模型的多模态能力和编程水平尚可,但存在长时间思考和查找目录文件等问题。

一、6 天 30 步 75 万条轨迹:从 Coding 到 3D、科研,持续探索 RL 扩展

罗福莉所说的大规模 RL 扩展,在 MiMo-V2.6 的技术报告里以一串数字的形式呈现,为其 6 天的直播训练过程中,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 各自完成了 30 步,累计覆盖约 75 万条轨迹,对应训练成本约 85 万美元和 262 万美元。经过这一轮训练,两款模型的训练任务平均通过率分别提升 25% 和 12%。

在 DeepSWE v1.1 测试中,Flash 从 48.8 分提升至 65.68 分,Pro 从 58.4 分提升至 72.57 分,分别增加约 17 分和 14 分。

在 RL 训练阶段,MiMo-V2.6 投入了大量算力,经过大规模、多任务强化学习训练,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 在多数 Agent Benchmark 上取得了接近 Claude Opus5 和 GPT-5.6 Sol 的分数。

训练系统方面,RL 算力扩展主要体现在训练规模、任务环境和基础设施三个方面。小米采用全异步架构,单次更新 1568 个样本,训练最高支持 100 万 token 上下文,每个 RL step 消耗约 35 亿至 37 亿 token。

训练任务也不再局限于编程,而是覆盖通用 Agent、视觉和 Cyber 等场景,并混合多种 Harness,让不同任务产生的训练信号能够共同作用于模型。

奖励机制也进行了创新,对于长程 RL 任务,小米采用组内评分机制,将同一任务下不同轨迹的完成情况和质量放在一起比较,再重新分配奖励信号。这样既能区分 " 完成了任务 " 和 " 高质量完成任务 " 的差异,也能引导模型减少完成单个任务所需的路径和 token。

随着训练规模扩大,稳定性问题也随之出现,小米冻结了 MoE Router,以减少训练过程中的模型漂移;针对 Reward hacking,则从奖励设计、对抗评估到验证器交叉校验设置了多层防护。在工程层面,小米还统一了轨迹表示和惩罚机制,并针对不同 Agent 框架进行高并发交互。

在训练规模扩大之后,MiMo-V2.6 的能力覆盖范围也随之扩展。新一代模型处理的任务已经从编程进一步延伸到 3D 内容、计算机操作、设计、视频和音乐等场景。

比如在 3D 游戏开发任务中,模型可以接收一段视频、一张图片或一句提示词,自行拆解任务,协调多个 Agent 搭建 3D 场景、实现交互逻辑,并根据渲染结果进行视觉检查和迭代。

MiMo-V2.6 演示案例(来源:小米)

在 Blender 中,它还可以根据文本描述或参考图片生成 3D 资产,并进一步将其用于动画、3D 打印和游戏开发。

MiMo-V2.6 演示案例(来源:小米)

通过 Computer Use,MiMo-V2.6 可以进入具身仿真环境。模型能够接收多视角相机画面,持续进行推理和决策,再通过视觉反馈控制 Franka Panda 机械臂,完成物体抓取、颜色匹配和精确放置。

MiMo-V2.6 演示案例(来源:小米)

设计类任务也在能力范围之内,MiMo-V2.6 可以生成完整的前端界面或演示文稿,其中包含版式结构、组件、交互元素和动效,并能够与 Figma 以及图像、视频生成工具配合。

MiMo-V2.6 演示案例(来源:小米)

MiMo-V2.6 系列模型还可以进行视频制作,在小米展示的一支产品宣传片中,从视觉设计、镜头与动效编排,到音乐创作和卡点剪辑,都由模型完成。

MiMo-V2.6 演示案例(来源:小米)

音乐是新增的能力,小米方面称,MiMo-V2.6 强化了音乐理解、审美判断和乐理运用,并首次探索了作曲任务。

MiMo-V2.6 演示案例(来源:小米)

小米方面展示的科研案例进一步展现了通用能力的迁移。小米明确表示,这些科研任务并没有经过专门的科研 RL 训练,更多依靠模型已有的通用能力完成。

材料科学方面,小米让 MiMo-V2.6-Pro 设计一种用于吸附全氟和多氟烷基物质(PFAS)的全新金属有机框架(MOF)。在材料专家的引导下,模型完成网络检索、文献与专利梳理、提出假设和新颖性评估,随后调用开源计算工具搭建仿真环境,计算 MOF 与 PFASs 之间的结合强度,最终筛选出三种候选框架,再交由湿实验进一步验证。

MiMo-V2.6 演示案例(来源:小米)

数学方向则是对 Li 与 Yorke 经典论文《周期三蕴含混沌》中主定理进行 Lean 4 形式化。研究者设计探索策略后,MiMo-V2.6-Pro 通过 subagent 协作推进定理陈述与证明,最终项目包含 6000 多行 Lean 代码,并通过 Lean 内核完成完整验证,没有留下未完成的证明占位符。

MiMo-V2.6 演示案例(来源:小米)

二、赛车游戏开发、小米汽车官方设计,容易长考,爱翻目录

智东西首先测试了一下基础的多模态能力,输入一张 Hermes Agent 应用的截图,让 MiMo-V2.6-Pro 不依赖工具进行识别,模型很快完成了读图任务,精准度不错,但速度稍慢。

同样的提示词,更换了模型和截图,我们让 MiMo-V2.6-Flash 来执行一下这项任务,能看到 MiMo-V2.6-Flash 仅用了 6 秒,但返还的结果在内容丰富程度上比 Pro 模型差很多。

首先我们用一个网页开发任务来对 MiMo-V2.6-Flash 的网络搜索、文件操控和前端设计能力进行测试,让 MiMo-V2.6-Flash 自行搜索信息并开发一个小米汽车官网的 Demo。

在这项任务中,虽然我们给出的提示词对网页开发的要求非常高,但是 MiMo-V2.6-Flash 作为 Flash 级别模型,整体的开发时间还是过长,不过网页开发的质量不错,网页的交互流畅程度以及图片嵌入都不错,比如下面这里演示的预约试驾功能。

不过美中不足的是,MiMo-V2.6-Flash 开发的小米汽车官网,虽然文字部分都是小米汽车的性能参数,搜索并嵌入的图片却是奔驰、宝马、奥迪。

最后智东西输入了一个经典赛车游戏开发提示词,测试一下 MiMo-V2.6-Pro 的游戏开发能力,提示词如下:

MiMo-V2.6-Pro 花了 64 分钟完成了游戏开发任务,开发出的游戏效果存在不少问题,赛道本身不清晰,路径没有严格限制好,初始状态下赛车的建模被埋在了下方,做得比较好的地方是游戏操控感和整体的光影效果。

此外,在测试 MiMo-V2.6-Pro 游戏开发能力的时候,智东西还输入了一个 3D 世界游戏开发的提示词,在没有专业游戏开发工具依赖的情况下,MiMo-V2.6-Pro 最终交付的 3D 世界本身的构建还是不错的,功能、下落的雨丝以及人物动作都比较合理,仅存在雨伞不在手上的小问题。

整体实测下来,MiMo-V2.6 系列模型和上一代给我们的感受差不多——主打性价比。模型基础能力是不错的,只是在思考时间上和执行任务的路线上存在一些问题,整体模型在任务交付效率上稍弱一些。

当然,智东西所做的实测都是基于 OpenCode 上所提供的模型进行的,不能代表模型小米官方 Agent 和 API 中的实际效果,也不能完全代表模型能力。

结语:小米 RSI 道路新作,但模型能力仍需更多实测验证

从这次发布来看,MiMo-V2.6 把重点放在了大规模 RL 训练的进一步扩展上:6 天完成 30 个 RL step、覆盖约 75 万条轨迹,训练任务也从 Coding 延伸到 Agent、视觉、3D、Computer Use 以及科研任务。

与此同时,小米将 RL 训练环境、代码和技术报告一并开源,把训练过程中的基础设施、奖励机制等细节也公开出来。

从 Benchmark 到实际测试,MiMo-V2.6 展现出了较强的基础能力,但不同任务之间仍存在明显差异。尤其在长程任务中,模型的思考时间、工具调用和执行路径都会直接影响最终交付效率,实测过程中的表现也存在很多问题。

模型最终能走到什么位置,除了榜单分数,后续实际使用中的任务完成质量和效率同样重要。

小米希望通过持续扩大 RL 训练规模探索 RSI,这条路线能否进一步提升模型的自主任务能力,还需要后续版本和更多实际任务来验证。

相关标签

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容