文|王欣逸
编辑|张雨忻
如果你近期有和投资人闲聊两句,会得出这样一个结论:AI 圈的关注点再一次回到了模型和 AI Infra(基础设施)。模型,对应着时下应用遇冷,热度向上游转移;而 AI Infra 的关注点之一,是后训练平台和推理平台。
昨天,Mind Lab 发布了他们的最新成果:推出面向行业的模型后训练与推理平台 Mint Recursive,以及基于这一平台做后训练的模型 Macaron-V1.1。
Macaron-V1.1 是一个基于 GLM-5.3 做后训练、参数为 752B 的模型。 7 月,Mind Lab 创始人陈锴杰告诉我们,从基于 GLM-5.1 后训练的 Macaron-V1-Preview 到基于 GLM-5.2 的 Macaron-V1,中间只隔了不到一个月。而迭代还在加速,据了解, Macaron-V1.1 从上一代迭代而来仅用了不到两周。
Macaron-V1.1 由 744B 的基座模型和四个 2B 的 LoRA 专家模块组成,其中四个 LoRA 分别负责 Chat、Agent、Coding 和 Generative UI(生成式 UI)。
从 V1 的 1B LoRA 变成了现在的 2B LoRA,他们也正在摸索更为理想的专家参数规模。从 Benchmark 结果来看,相比 V1,V1.1 在 6 个 Agent 榜单上全面提升,在 SWE-Marathon(超长程 AI 编程能力)表现尤为出色。。

更值得注意的是,Macaron V1.1 完全基于 Mint Recursive 完成训练。
Mint Recursive 是一个后训练与推理平台,其工作流程包括测评、数据、后训练与部署推理,用户通过 API 和 Python SDK 即可调用平台的训练和部署能力;还能接入生产环境中的反馈,让模型在真实任务中持续改进。而这套流程,Mint Recursive 在 Macaron V1.1 模型的迭代上已经跑通。
就在这一节点,Mind Lab 集中发布了一系列成果,把过去一段时间在持续学习与 Infra 领域积累的 Know-how,沉淀为一套可对外提供的服务。
做后训练的 Infra
Mind Lab 一边做模型、一边做 Infra,这并不让人意外。
在今年 1 月,他们就率先推出了 Mint Recursive 的早期形态——一个关于 LoRA 训推的基础设施平台,为客户提供大模型后训练全流程解决方案。
与此同时,在 Infra 层面下功夫,正慢慢成为一个行业共识。
几天前,智谱创始人、首席科学家唐杰在 X 上发了一篇长文,阐述了他们用 AI 改进 AI 的最新进展,他们让 GLM-5.3 驱动的 Infra Agent,自动优化 GLM-5.3 自己的推理引擎,让一个超 10 万张国产芯片组成的集群,在不到两周的时间里,将端到端吞吐提升至初始基线的 3 倍。
智谱正在做的就是让 AI 去自我改进推理层 Infra。同样是模型参与优化自己,大家想解决的问题不同—— Mind Lab 要做一个后训练平台,想优化的是从整个后训练到部署推理的流程,囊括数据、评测、部署、反馈收集等步骤。
Mint Recursive 平台由三大模块组成:Train&Deploy(训练与部署)、Env Hub(环境中心)、Data&Experience(数据与经验)。这一平台支持模型、SFT(监督微调)、RL(强化学习)、DPO(偏好训练)、全参微调等算法,兼容 GLM、Qwen、DeepSeek、Kimi、MiniMax 等多种尺寸的开源模型;训练完成后可一键部署,还有配套的测评体系,为下一轮模型训练做准备。
去年 9 月,OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 发布了一篇名为《LoRA Without Regret》的技术博客,从理论和实验上证明了,只要方法得当,LoRA 的效果可以比肩全参数微调。从那以后,LoRA 几乎成了后训练领域的普遍采用的方案。
值得一提的是,Mind Lab 一直关注 "LoRA" 这一后训练范式,这次他们也在这条路线上更进一步,在 Mint Recursive 中,他们用 LoRA 把训练和部署都做成了 Serverless(无服务器)的模式:客户无需自己买 GPU、管理集群,可以直接按 Token 用量计费。
在训练侧,Mint Recursive 想实现的是让模型更聪明——用 LoRA 的方式,只训练一些少量的新增参数,根据业务目标,不断从业务反馈中学习、持续迭代能力,让模型变得更懂业务,与此同时,还能显著降低企业后训练的开销。
在部署侧,4 个 LoRA 专家模块对应的 4 个业务版本各自是一个轻量级的 Adapter(外挂插件),挂在同一个基座模型上。这些 Adapter 互不干扰、非常灵活,每个 Adapter 都能单独升级、上线与下线,历史版本也保留着,便于客户对照与回滚。客户也可以把某个 Adapter 合并到基座模型里,变成一个完整的、独立的模型。
这也正是 LoRA 的核心思路,共用基座模型,在每个业务场景只做针对性的后训练。好处在于,模型后训练、部署与迭代的成本能实现大幅下降,调整权重也更加灵活。
后训练所需的数据、评测、反馈等,每一步都离不开 Infra 的支撑。从做后训练到做后训练 Infra,Mind Lab 的选择很自然。
但在交出 Mint Recursive 答卷之前,他们也能做了很多准备:
2025 年,Mind Lab 开始在 Kimi K2 这样的万亿参数模型上做后训练研究,Mint Recursive 的基础设施最早也是那时开始搭的;
随后,2025 年底,他们向 NVIDIA Megatron-Bridge 贡献了业界首个 1T 参数量级的 LoRA-RL,为 Megatron 补充了面向超大规模基座的轻量化强化学习的经验;
2026 年中,参与火山引擎的强化学习训练框架 veRL、NVDIA 的下一代训练后端 megatron_lite 等多个开源项目,提供了一些 LoRA 和强化学习解决方案;
2026 年 7 月,Macaron-V1 系列正式发布并开源,验证了这套训练方案在 Agent、Coding 等任务中的有效性。
Infra 很重要,但不是所有公司都能做 Infra,以及有必要单独做 Infra。
万亿模型的后训练,工程难度远超想象。分布式训练的显存调度、训推一致性的精度对齐、异步 RL 的权重热更新,对于一家创业公司而言,每一块都是硬骨头。
陈锴杰告诉我们,训练小模型的强化学习其实很容易,但是一旦规模上来了,难度会变得非常大,尤其是他们还在强化学习之上,叠加了 LoRA 的持续学习训练方法。
目前,Mint Recursive 主要提供三种服务:类似 FDE 形式的专家与企业一起完成训练;依托平台进行自动化训练;企业通过 API 和 Python SDK 自主训练。
训一个企业自己的模型
越来越多企业想要拥有自己的模型,这也是轻量的后训练、持续学习的训练范式被推崇的原因。
从落地角度看,企业端或许是定制化模型最为迫切的场景。" 通用大模型仅能覆盖各行业 20%-30% 的场景,剩下 70%-80% 的部分,都需要垂直持续学习来优化。" 陈锴杰提到。
海外市场已经先一步验证了这个趋势。Fireworks AI,一家做开源模型推理和后训练托管的硅谷公司,今年 7 月,其估值已经达到 175 亿美元,ARR 突破 10 亿美元,日 Token 处理量超过 40 万亿。
Fireworks AI CEO 乔琳在和红杉的对谈中提到:" 后训练已经不是模型团队专属游戏了,AI 产品在找到 PMF、开始规模化后,后训练几乎是它们绕不开的一门必修课。"
具体来看,相比于模型厂商,AI 产品公司的壁垒在于用户真实使用产生的数据、真实任务、反馈与偏好等。Fireworks 平台上 95% 以上的流量,来自客户自己微调的专用模型,而不是通用基座。这一逻辑,被乔琳定义为 " 拥有自己的智能 "。
" 应用公司做模型 " 这一选择,正发生在越来越多的企业身上—— AI 应用的竞争点从产品本身,逐渐变成产品的经验智能,包括自己的判断、Taste、业务数据和对客户的理解等方面。
应用公司最独特的资产来自真实生产环境:它知道用户究竟想完成什么、哪些结果算好、哪里反复失败,以及专业人员真正怎样判断结果。如何让企业拥有自己的智能、把行业经验合并进基座模型中?
Mint Recursive 在尝试的就是 让企业建立起自己的评测体系、奖励机制、训练数据,把后训练做成一个持续迭代的闭环 :模型在服务用户后积累下真实任务场景数据,每次交互的轨迹,无论成功还是失败,都会被完整记录下来。
这其中,失败的轨迹相当有价值,哪里做错了、为什么错、应该怎么改,平台在找到问题和解决方法后,这些判断和轨迹会直接变成新的训练数据;用新数据重新训练完上线后,又会产生新的反馈,新的反馈又变成下一轮训练的输入,如此循环往复。
平台中的 Env Hub(环境)环节容易被忽略,但它尤其关键。英伟达的一篇 Agentic RL 技术博客中提到,做 Agent 强化学习需要环境来定义数据集、验证器和状态。环境不只是模型的训练场,也是评测场,评测、合成数据、强化学习,都可以在一套环境中完成。
尽管 Mint Recursive 中的 Recursive(递归)还处于初级形态——人依然在递归的回路中,离模型全自动自己训练还比较遥远,但模型迭代方向已经很明确了。对客户而言,更为重要的不是模型本身,而是企业手里的一线业务现场与独一无二的真实业务数据。
图片来源|企业供图
欢迎关注~
欢迎交流~
本文来自微信公众号" 智能涌现 ",作者:王欣逸,36 氪经授权发布。