文 | 硅谷 101
8 月 13 日凌晨,DeepSeek V4 Pro 正式登场,给开源模型生态又添一把猛火。从 Kimi K3 到 MiniMax H3,再到 DeepSeek V4 flash、DeepSeek V4 Pro,在中国开源模型的猛攻之下,美国的 AI 公司这次是真的坐不住了。

为什么这些平时斗得最厉害的公司,这次却罕见地站到了同一战线?而 Anthropic 坚持不加入的原因又是什么?
要回答这个问题,我们得先搞明白一个更基础的事情,那就是今天 AI 行业所说的 " 开源模型 " 到底是什么?以及模型开源之后,对于模型厂商以及整个行业又意味着什么?


第一,训练数据。研发团队首先要决定使用什么数据训练模型,比如网页、书籍、代码,以及不同类型数据如何配比,再经过清洗和筛选。这一步,决定了模型的 " 底子 " 好不好。
第二,模型架构和参数规模。这个阶段主要进行模型规划和设计,包括采用什么模型架构、参数规模有多大,以及各种训练配置。这些设计,决定了模型的能力上限和训练效率。
需要注意的是,参数规模并不是指训练数据的大小。训练一个模型,本质上是在不断地做 " 调整 ",而参数规模说的是 " 这次总共要调整多少个地方 "。参数规模越大,模型能捕捉和处理的细节、规律也越复杂。
第三,训练基础设施。模型设计完成后,需要庞大的算力来完成训练,包括 GPU 集群、高速网络、存储系统以及各种训练框架。而如何把这些算力高效组织起来,正是如今最火的 AI Infra(人工智能基础设施)领域。像 DeepSeek 的 DeepGEMM、Kimi K3 的 FlashKDA、MoonEP,都属于这一层的创新。
数据、架构和基础设施准备完成后,才进入真正的训练阶段。
第四,训练流程和 Checkpoint。在这个阶段,模型会进行预训练、微调和强化学习,在训练过程中,也会不断 " 存档 ",方便继续训练、测试或回滚。
第五," 模型权重 "。经过漫长的训练之后,模型内部数十亿甚至数万亿个参数都会被逐步调整到合适的数值。这些参数最终形成的集合,就是 " 模型权重 ",也是整个模型最核心的成果,记录着模型在训练过程中学到的知识和能力。
第六,模型部署。训练完成后,还需要将权重部署到服务器,通过 API 或者本地部署的方式,真正提供给开发者和企业使用。
最后," 技术报告 "。这些流程结束之后,模型厂商们通常还会写一个 " 技术报告 "。里面会介绍模型架构设计的思路、数据大致的构成、训练中踩过的坑和最终的评测结果等内容,让外界理解这个模型是怎么做出来的。但技术报告不是可以照着复现的操作步骤,它讲的更多是一种方法论。
清楚了训练流程之后,那么 " 开源 " 具体是指开放的什么环节呢?按照模型的开放程度,现在主要分为闭源、开放权重和完全开源这三大类型,我们先说两端。

完全开源的模型叫 Open Source,是指从训练数据、训练代码到中间存档、技术报告都完全公开。Ai2 (艾伦人工智能研究所)推出的 OLMo 系列,就是这样的代表。
但现在说的大部分的开源模型,其实都不是真正的 Open Source,而是位于开源和闭源中间地带的 Open Weight(开放权重)。相当于只是送出了模型训练的最后结果,大家可以直接拿去用,也可以在结果之上进行微调和改进。
但现在不同的开放权重模型之间,开放的程度也存在很大差异,我们用几个比较具有代表性的模型来具体说明一下。
首先," 模型权重 " 严格来说只是一个巨大的数字文件,光靠它并不能直接运行。如果从 Hugging Face 上直接下载 Kimi K3 的权重,得到的是约 2.8 万亿个浮点数,按照模型架构规定的顺序,整齐排列在其中。
所以,除了权重本身,厂商通常还会公开一份推理代码,专门负责教用户如何读取权重文件、按照什么顺序进行计算,以及最后怎么把结果变成一句话回复用户。
最基础的 " 开放权重 ",就是把模型权重以及这个能跑、能微调的推理代码公布出来,让任何人都可以把模型下载到自己的服务器上运行。其中最具代表性的,就是 Meta 的 Llama 系列。

此前,从 Llama 1 到 Llama 3,Meta 还会发布较为详细的技术报告,分享模型设计和工程经验。但到了去年的 Llama 4,Meta 只发布了一篇简短的博客,没有再公开完整的技术报告,开放的程度也变得更加保守。

在此之前,大部分模型厂商的技术报告更像是公关稿,通常会告诉大家模型有多少参数、在哪些 Benchmark(基准测试)上取得了什么成绩,却很少解释这些成绩是怎么做出来的。
但 DeepSeek V3 和 DeepSeek-R1 却把过去一些很少公开的研发细节,几乎毫无保留地写了出来。比如,它详细介绍了 MoE(混合专家)模型是如何设计的、为什么要采用 Multi-head Latent Attention(MLA)来降低 KV Cache 的内存占用、FP8 训练是如何稳定实现的,以及不同方案之间,为什么最终选择了现在的设计、放弃了其他路线。

可以说,DeepSeek 开启了一种新的模型开放形式,而此次 Kimi K3 也延续了这种做法。
除了公布非常详细的技术报告,介绍模型架构、训练方法和大量工程细节,Kimi K3 此次还同步开放了三大自研底层基础设施。其中包括解决 MoE(混合专家)模型里几百个 " 专家 " 之间通信效率的 MoonEP,加快注意力计算的 FlashKDA,以及给智能体训练搭建可运行的环境的 AgentEnv。
这三项分别对应训练大模型时会遇到的三个卡点:通信、计算、训练环境,也让大家能更了解 Kimi 团队是怎么高效训练出这个模型的。

而且,开放权重也并不意味着毫无限制。真正决定开发者能不能将模型商用、修改以及再发布的,是模型附带的许可证(License)。

比如,DeepSeek 最早发布模型时采用的是自己制定的协议,对使用场景还有一些限制。但到了 DeepSeek-V3 和 R1,已经全面切换到了 MIT License。这意味着,只要保留版权声明,开发者几乎可以自由下载、修改、商用,限制非常少。
阿里的 Qwen 也走了一条类似的路线。从最初采用阿里自定义协议,到后来切换为国际上广泛使用的 Apache 2.0 许可证,同样大幅降低了商业使用门槛。值得注意的是,此前 Qwen 的旗舰 Max 系列一直是保持闭源、只能走 API,但在这个月初,阿里表态,将首次把旗舰模型 Qwen3.8-Max 的权重开源。

当然,也并不是所有公司都会选择 " 完全放开 "。 Kimi 之前的 K2 系列用的是一种叫 Modified MIT 的许可证。但这次 K3 启用了一份全新的,叫做 Kimi K3 License 的协议,不再自称是 MIT 的修改版。
对绝大多数开发者和中小企业来说,其实实际使用体验和 MIT 差别不大,因为都是免费下载、商用和修改。但它加了两道门槛:一是产品月活超过 1 亿或者月收入超过 2000 万美元的,需要在界面上显著展示 "Kimi K3" 标识;第二,如果做的是模型即服务的托管生意,且连续 12 个月总收入超过 2000 万美元,就必须先和月之暗面另行签署商业协议才能商用。
而限制最多的,则是 Meta 的 Llama。它没有采用 MIT、Apache 这些主流开源许可证,而是自己制定了一个 Llama Community License,中间的限制非常多,例如月活用户超过 7 亿的产品需要额外申请授权,部分版本曾限制在欧盟地区使用,同时协议还明确禁止开发者利用 Llama 的输出去训练其他大型模型等等。
不过 Meta 近期也在重回开放路线,它们最新发布了 300 亿参数的开放权重模型 Muse Glimmer,就采用了 Apache 2.0 许可证。此外扎克伯格还宣布,Meta 目前最强基础模型 Muse Spark 1.2 也即将开放权重。
王铁震
前 Hugging Face 亚太生态负责人
把这些东西写清楚之后,很多专门做模型推理和云服务的厂商实际上就没有办法 take free ride(不劳而获)。过去一些开源项目,包括开源数据库,最担心的就是云厂商没有出工、没有出力,却可以直接把开源项目部署到自己的云上赚钱。所以,这种不劳而获,一直是开源社区想要避免的。
当然,许可证只是划定了红线,并不能把模型变成收入。那么,这些开源模型的公司靠什么赚钱呢?
实际上,开放权重并不等于放弃商业化。企业下载模型只是第一步,要真正把模型稳定部署到生产环境,还需要算力、运维、持续更新以及针对业务场景的定制开发等等。相比自己组建团队,很多企业依然会选择直接购买模型公司的 API 服务、企业版部署或行业解决方案。
因此,开放模型可以带动一整套围绕模型的服务收入。
第一种,是通过开放模型带动云计算和基础设施消费。
以千问为例,模型权重虽然可以免费下载,但企业想要大规模部署,依然需要 GPU、云存储、网络、数据库和模型管理平台。对于阿里这样的云厂商来说,开放模型更像是一个入口:模型本身可以免费,但运行模型所需要的整套云服务都是收费的。
第二种,是为企业提供部署和定制服务。
很多金融、医疗、政府或大型企业不希望把内部数据发送给外部 API,而是希望把模型部署在自己的服务器或私有云里。但下载权重之后,企业还需要完成模型适配、数据清洗、安全评测、推理优化和后续维护。
模型公司可以向这些客户出售私有化部署、行业微调、技术支持和长期维护服务。
第三种,则是提供收费的后训练和模型开发平台。
现在的企业更希望在现有开放模型的基础上,加入自己的数据和业务规则,把它变成更适合特定任务的专用模型。模型公司可以提供微调、强化学习、评测、数据管理和版本管理等工具,并按照训练算力、使用量或企业订阅收费。像 Thinking Machines 的思路,就更接近这种。
Keith Zhai
TinyFish 联合创始人
关于 AI,一个核心问题是,intelligence(智能)到底应该是我租借来的,还是应该真正变成自己的。而整个的大背景是,越来越多企业正在接受这样一种观点:智能应该为我所有,而不应该是租借。
以 Kimi 为例,虽然模型权重已经开放,但它们依然提供付费订阅、API 调用以及企业级 AI 服务。
除此之外,开源模型厂商的另一部分收入来源,是提供模型服务的 MaaS(Model as a Service)厂商和云厂商。
MaaS 厂,包括最近很火的 Together AI、Fireworks AI 等等,是把开放权重模型部署到自己的 GPU 集群上,再通过 API 提供给开发者使用。云厂商,也就是大家熟悉的卖基础设施的 AWS、阿里云等等,现在也会卖模型服务。在 K3 这样的许可证下,这类厂商也要向 Kimi 交钱。
公开信息显示,Moonshot AI 当前的年化经常性收入(ARR)已经达到约 3 亿美元。

所以,开放权重并不意味着商业价值的消失,更多的是一种商业模式的变化。而对于整个 AI 生态来说,它也有着非常重要的价值。

而开放权重,则让拥有前沿能力的 AI 模型可以像软件一样,被下载、部署、微调,并在此基础上继续创新。
对于企业用户来说,这绝对是件天大的好事。
首先是成本。还记得今年年初编程 Agent 开始流行,每家企业都开始 token maxxing 的几个月吗?这一通操作下来,每家公司都发现自己的 token 账单水涨船高。在这样的背景下,开源模型显然成了最优解。毕竟,中国开源模型能力已经能追平最强闭源模型,又很便宜,还能自己调整,谁不爱呢?
而现在一种主流的企业做法就是:最困难的任务还是使用几家能力最强的闭源模型,日常的任务就都通过中国的这些开放权重模型来实现。
其次,是所有权问题。
如果模型的一切都取决于对方是否开放,就像 Fable 今年早一点的事情,对大家影响很大的。突然有一天,美国商务部说不可以用了,那就一夜之间就都不可以用了,之前做的部署可能都没有了,那这种情况怎么办?
这就是为什么对于企业来说,在能力几乎相当的情况下,开放模型有绝对的优势了。而对于普通开发者来说,开放权重也大大降低了参与模型创新的门槛。
以前开发者想要基于 GPT 或者 Claude 开发产品,能做的事情其实很有限。但借助权重和技术报告,开发者就能够自己去尝试修改模型、继续训练模型,甚至让模型适配完全不同的场景。
而且现在 vLLM 和 SGLang 等开源推理引擎都能够对大部分开源模型做到 Day-0 支持,这也意味着开发者们不需要自己解决复杂的推理部署问题,就能直接部署模型。
如今,开放权重模型已经成为大量 AI Agent、机器人等项目的重要基础,推动着整个 AI 创业生态的繁荣。
此外,开放权重本身也在加速着模型的迭代。比如在 Kimi K3 的技术报告里,有一部分专门介绍了他们如何优化 MoE(混合专家)模型中的负载均衡,而这套方法就是他们在 DeepSeek V3 方案基础上的继续演进。
闭源模型的技术突破,很可能永远留在自己的服务器里。但借助于开放的技术经验,整个行业就能够站在巨人的肩膀上加速往前走。
所以无论是从商业、还是整个 AI 生态的角度,开放权重都正在成为非常重要的一条技术路线。这也是为什么此次黄仁勋会牵头来做这件事,并且一呼百应。
最近针对中国开源模型的强势崛起,有消息传出美国政府正在考虑采取相关限制行动。

但这个联盟背后也有着更深的商业考量。比如对于微软、亚马逊、谷歌这几个大型云厂商来说,不管客户最终部署的是 OpenAI、Llama、DeepSeek 还是 Kimi,只要运行在云上,它都能够从中获益。
对于英伟达、AMD、Baseten 这样的基础设施企业来说,开放权重意味着会有更多企业、开发者和国家,把模型部署到自己的服务器。而每一次部署、微调和推理,都会带来新的算力需求。不少基础设施公司的业务增长,甚至就是伴随着一代代开源模型而发展壮大。
(英伟达)从芯片、基础设施的角度看,它肯定是所有人,每个人都能自由搭建一个模型最好。因为它并不在乎这个谁能挖到金子,重要的就是它能卖更多的铲子。
而对于像 Palantir、Databricks 这样的企业软件和 AI 应用公司来说,它们卖的本来就是模型之上的数据平台、AI 应用和行业解决方案。模型越开放,它们能够服务的客户和场景反而越多。
目前,这个联盟名单几乎聚齐了美国所有主要 AI 公司的名字,但唯独少了 Anthropic,它们为此也专门发了一篇长文来阐明立场。

第二是蒸馏问题。它认为中国的开源模型之所以发展的这么快,就是大规模地蒸馏了美国最前沿的这些闭源模型,进而也会大幅降低追赶最前沿模型所需要的算力。与其纠结要不要管开源,美国政府更应该先管管 " 蒸馏 "。
但很多人认为,Anthropic 之所以坚持不开源,更多的也是出于商业利益的考虑。
对于闭源模型公司来说,开放权重无疑是会严重冲击它们的商业模式。因为一旦越来越多高性能的开放模型出现,企业就有了更多本地部署和自主定制的选择,对闭源 API 的依赖也会降低。而模型能力本身也更容易被快速追赶和复制,让闭源模型赖以建立的竞争壁垒受到挑战。
而最近,在美国全行业越来越强的开源声势下,Anthropic 坚持闭源的立场现在正在遭受着越来越大的压力,对它 AI 安全立场的质疑声也逐渐变大。
但是我们也看到,并不是所有人都反对 Anthropic 的这些观点。比如本次 Kimi K3 开源之后,网上就出现了不少声音,认为把这样已经达到最前沿能力的模型开放出来,本身就是一种风险。

而如果未来,越来越多能力接近 Fable 5 这一水平的开放权重模型被部署到成千上万家企业、本地服务器甚至个人设备上,情况就会变得更加复杂,模型治理、安全更新和风险控制必然将面临更大的挑战。
目前业界关于开源模型的讨论还在激烈的进行着,但无论如何,开放权重已经成为推动这一轮 AI 发展的重要力量。它降低了技术门槛,加快了创新速度,也让越来越多企业和开发者有机会参与到 AI 生态中。
但与此同时,它确实可能也会带来新的问题和风险。接下来,我们也会持续追踪中美开源模型的发展,以及它对整个 AI 产业的影响。