
作者 | 毕伟豪
编辑|李水青
智东西 9 月 22 日报道,今早,小米大模型团队发布并开源了新一代模型 Xiaomi MiMo-V2.6 系列,包含两款原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,小米还将逐步开放 MiMo-V2.6-Pro-UltraSpeed,相比 MiMo-V2.6-Pro,同等智力水平输出速度提高 20 倍。

此外,小米还同步开源了用于新模型训练的 RL 环境和框架以及模型技术报告。

罗福莉早上发文称,MiMo-V2.6 押注大规模 RL 扩展,进行了开源模型迄今最大规模的单次 RL 训练,团队将其视为探索 RSI(递归自我改进)、通往 AGI的新一步,她直言 MiMo-V2.6 的创新和工程难度已经超过了 DeepSeek R1。

MiMo-V2.6-Pro在 Artificial Analysis 智能指数上取得 46.32 分,超过 Kimi K3 与 Qwen3.8 Max,成为该榜单迄今得分最高的开源模型,不过从得分上看总体与顶尖开源模型差距不大,其得分与刚刚发布的 Grok 4.7 相当。

在主要测试 AI 网页开发能力的 Code Arena WebDev 榜单中,MiMo-V2.6-Pro 首测拿下 1628 分,较上一代 MiMo-V2.5-Pro 的 1475 分大涨 153 分,目前排名全球前十、开源权重模型第三。

价格方面,MiMo-V2.6 系列维持 V2.5 系列的 API 定价,MiMo-V2.6-Pro 输入(缓存命中)0.025 元 / 百万 tokens,缓存未命中 3 元 / 百万 tokens,输出 6 元 / 百万 tokens;MiMo-V2.6-Flash 输入(缓存命中)0.02 元 / 百万 tokens,缓存未命中 1 元 / 百万 tokens,输出 2 元 / 百万 tokens;MiMo-V2.6-Pro-UltraSpeed 定价是 MiMo-V2.6-Pro 的十倍。

有网友晒出 MiMo-V2.6-Pro 与 Grok 4.7 的价格对比,同等智力水平下,Grok 4.7 的价格大约是 MiMo-V2.6-Pro 的 29 倍。

Xiaomi MiMo-V2.6 系列发布的预热方式也非常有趣,9 月 17 日凌晨,罗福莉在社交媒体上发布了两款模型的训练数据实时看板,全网 " 直播 " 了小米 MiMo-V2.6 的训练细节,两轮训练平均每小时烧掉了 3.08w 美元。

有网友评论称这是有史以来最酷的开源发布之一,不仅直播训练过程,还开源了技术细节,性能超强的同时,定价低到离谱。

不过也有开发者对模型能力提出了质疑,认为 MiMo-V2.6 系列至少 Flash 模型没有达到预期,在 OpenCode 中会不断循环执行命令和读取文件,执行能力较差。

智东西第一时间在 OpenCode 中对 MiMo-V2.6 系列模型进行了实测,从实际效果上看,MiMo-V2.6 系列模型的多模态能力和编程水平尚可,但存在长时间思考和查找目录文件等问题。
一、6 天 30 步 75 万条轨迹:从 Coding 到 3D、科研,持续探索 RL 扩展
罗福莉所说的大规模 RL 扩展,在 MiMo-V2.6 的技术报告里以一串数字的形式呈现,为其 6 天的直播训练过程中,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 各自完成了 30 步,累计覆盖约 75 万条轨迹,对应训练成本约 85 万美元和 262 万美元。经过这一轮训练,两款模型的训练任务平均通过率分别提升 25% 和 12%。
在 DeepSWE v1.1 测试中,Flash 从 48.8 分提升至 65.68 分,Pro 从 58.4 分提升至 72.57 分,分别增加约 17 分和 14 分。





在训练规模扩大之后,MiMo-V2.6 的能力覆盖范围也随之扩展。新一代模型处理的任务已经从编程进一步延伸到 3D 内容、计算机操作、设计、视频和音乐等场景。
比如在 3D 游戏开发任务中,模型可以接收一段视频、一张图片或一句提示词,自行拆解任务,协调多个 Agent 搭建 3D 场景、实现交互逻辑,并根据渲染结果进行视觉检查和迭代。

在 Blender 中,它还可以根据文本描述或参考图片生成 3D 资产,并进一步将其用于动画、3D 打印和游戏开发。

通过 Computer Use,MiMo-V2.6 可以进入具身仿真环境。模型能够接收多视角相机画面,持续进行推理和决策,再通过视觉反馈控制 Franka Panda 机械臂,完成物体抓取、颜色匹配和精确放置。

设计类任务也在能力范围之内,MiMo-V2.6 可以生成完整的前端界面或演示文稿,其中包含版式结构、组件、交互元素和动效,并能够与 Figma 以及图像、视频生成工具配合。
MiMo-V2.6 演示案例(来源:小米)
MiMo-V2.6 系列模型还可以进行视频制作,在小米展示的一支产品宣传片中,从视觉设计、镜头与动效编排,到音乐创作和卡点剪辑,都由模型完成。
MiMo-V2.6 演示案例(来源:小米)
音乐是新增的能力,小米方面称,MiMo-V2.6 强化了音乐理解、审美判断和乐理运用,并首次探索了作曲任务。

小米方面展示的科研案例进一步展现了通用能力的迁移。小米明确表示,这些科研任务并没有经过专门的科研 RL 训练,更多依靠模型已有的通用能力完成。
材料科学方面,小米让 MiMo-V2.6-Pro 设计一种用于吸附全氟和多氟烷基物质(PFAS)的全新金属有机框架(MOF)。在材料专家的引导下,模型完成网络检索、文献与专利梳理、提出假设和新颖性评估,随后调用开源计算工具搭建仿真环境,计算 MOF 与 PFASs 之间的结合强度,最终筛选出三种候选框架,再交由湿实验进一步验证。

数学方向则是对 Li 与 Yorke 经典论文《周期三蕴含混沌》中主定理进行 Lean 4 形式化。研究者设计探索策略后,MiMo-V2.6-Pro 通过 subagent 协作推进定理陈述与证明,最终项目包含 6000 多行 Lean 代码,并通过 Lean 内核完成完整验证,没有留下未完成的证明占位符。

二、赛车游戏开发、小米汽车官方设计,容易长考,爱翻目录
智东西首先测试了一下基础的多模态能力,输入一张 Hermes Agent 应用的截图,让 MiMo-V2.6-Pro 不依赖工具进行识别,模型很快完成了读图任务,精准度不错,但速度稍慢。




最后智东西输入了一个经典赛车游戏开发提示词,测试一下 MiMo-V2.6-Pro 的游戏开发能力,提示词如下:

此外,在测试 MiMo-V2.6-Pro 游戏开发能力的时候,智东西还输入了一个 3D 世界游戏开发的提示词,在没有专业游戏开发工具依赖的情况下,MiMo-V2.6-Pro 最终交付的 3D 世界本身的构建还是不错的,功能、下落的雨丝以及人物动作都比较合理,仅存在雨伞不在手上的小问题。
整体实测下来,MiMo-V2.6 系列模型和上一代给我们的感受差不多——主打性价比。模型基础能力是不错的,只是在思考时间上和执行任务的路线上存在一些问题,整体模型在任务交付效率上稍弱一些。
当然,智东西所做的实测都是基于 OpenCode 上所提供的模型进行的,不能代表模型小米官方 Agent 和 API 中的实际效果,也不能完全代表模型能力。
结语:小米 RSI 道路新作,但模型能力仍需更多实测验证
从这次发布来看,MiMo-V2.6 把重点放在了大规模 RL 训练的进一步扩展上:6 天完成 30 个 RL step、覆盖约 75 万条轨迹,训练任务也从 Coding 延伸到 Agent、视觉、3D、Computer Use 以及科研任务。
与此同时,小米将 RL 训练环境、代码和技术报告一并开源,把训练过程中的基础设施、奖励机制等细节也公开出来。
从 Benchmark 到实际测试,MiMo-V2.6 展现出了较强的基础能力,但不同任务之间仍存在明显差异。尤其在长程任务中,模型的思考时间、工具调用和执行路径都会直接影响最终交付效率,实测过程中的表现也存在很多问题。
模型最终能走到什么位置,除了榜单分数,后续实际使用中的任务完成质量和效率同样重要。
小米希望通过持续扩大 RL 训练规模探索 RSI,这条路线能否进一步提升模型的自主任务能力,还需要后续版本和更多实际任务来验证。