文 | 唐辰同学
K3 爆火,Kimi 却不得不按下暂停键。
7 月 19 日深夜,月之暗面 Kimi 团队发布公告,因 Kimi K3 上线 48 小时内,用户请求量大幅超出预估,由于算力资源紧张,暂停开放 Kimi 新用户订阅,将有限算力优先保障现有订阅用户。
会员体系随之拆分为 Kimi 主权益与 Code 权益,以精准分配资源。从稍后的官方回应看,Kimi 没有对会员体系进行调整,只是在有限算力下对用户体验的重新平衡。
也就是说,K3 火到触发算力 " 熔断 ",只能婉拒新客,专注服务老用户。
Kimi 的 " 韬定律 "
当下,各大模型厂商都在拼命的做大用户规模,通过免费、降价等性价比手段吸纳新用户。相较之下,Kimi 的反向操作就略显 " 凡尔赛 " 了。
但模型能力越强、上下文越长、用户调用越频繁,对推理算力的消耗也越高。在 "K3 请求量逼近现有算力集群的承载极限 " 的情况下,Kimi 也遭遇到 " 豆包式 " 的烦恼:C 端用户越多,对收入的贡献不明显,但 GPU 扛不住了。
作为月之暗面首款 3 万亿参数级 MoE 模型,K3 总参数规模达到 2.8 万亿。按照常规理解,这个规模的模型,每输出一次,算力都是指数级消耗。但在其独特核心架构的支持下,达到华为在芯片领域提出的 " 韬定律 " 效果。
这个架构也被视为是一架超级引擎,落地了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度 MoE,把每一分算力转化为模型效果的效率推到极致。
长期以来,芯片行业依赖摩尔定律,靠缩小晶体管尺寸提升性能。但当先进制程逼近物理极限、成本暴涨,单纯堆叠硬件的增长模式也走入瓶颈。
华为今年提出的 " 韬定律 ",跳出 " 空间缩微 " 的传统思路,转向 " 时间缩微 ":通过逻辑折叠、三维堆叠、全链路架构优化,压缩信号传输时延、减少数据冗余搬运,在成熟制程上实现媲美先进制程的能效跃升。
其核心方法论是:在硬件受限或成本约束下,通过系统级架构创新实现性能跃升。
在我看来,K3 所采用的 KDA 混合线性注意力机制,正是 AI 领域的 " 韬定律 " 实践。
要知道,Transformer 架构在注意力机制上最吃算力。标准注意力随序列长度呈平方级增长,百万级上下文任务中,大部分算力消耗在维持长序列的注意力矩阵上。KDA 机制将大部分注意力层的计算复杂度从平方级降至线性。
根据月之暗面此前发布的技术报告,在实验模型上采用 KDA 与 MLA 混合比例,KV 缓存占用最高削减 75%,100 万上下文长度下的解码吞吐量提升至原来的 6 倍。配合注意力残差与高稀疏度 MoE 技术,训练效率提升约 25%,额外成本不到 2%。
这是对 " 模型生产效率 " 的重构。如果说硅谷主流的 Transformer 路线是 " 大力出奇迹 " 的燃油车,KDA 更像是追求 " 热效率极致 " 的混动引擎。
SemiAnalysis 的报告指出,KDA 将推理速度提升 300%,同时在长上下文处理上保持接近 Transformer 的性能。这意味着同等算力投入下,K3 能产出更多有效智能。
开发者社区的实测反馈,在长流程 Agent 任务和代码生成方面,K3 表现突出,具备与国际头部模型竞争的实力。
从根本上说,K3 依然遵循 Scaling Law(缩放定律),但把刀挥向了粗糙的算法浪费。当硅谷 AI 企业还在不断囤卡、堆算力时,Kimi 通过重构算法链路、精简计算冗余,在有限算力的条件下,实现了性能与效率的平衡,走出一条 " 每瓦特智能产出比 " 最大化的路径。
这让华尔街观察人士和投资者感到意外,他们像惊诧 DeepSeek 一样,再度质疑硅谷数千亿美元投资 AI 是否能得到相应回报、美国 AI 领先优势是否被削弱。
与此同时,企业用户和开发者也都开始关注 AI 使用成本。其中一部分开发者已经用上 " 模型路由 "(Model Routing)服务,根据不同任务自动选择成本最低、效率最高的 AI 模型,这其中当然包括 Kimi 在内的中国模型。
杨植麟摸高
回过头来看,Kimi 算力被击穿是技术成功的副作用:模型效率的提升降低了单次使用成本,反而刺激了需求总量的暴涨。
值得一提的是,7 月 11 日,智谱创始人唐杰宣布 "Touch High 摸高计划 ",直言 " 不登顶,就是失败 ",并明确表示未来两年不追求短期应用变现,而是集中资源攻坚 AGI 的四大核心方向,并拟募集资金,计划投入百亿级资源突破机械可解释性技术。
如果说,智谱 " 摸高 " 是上市后的背水一战。其希望通过冲击技术的天花板,来夯实 " 全球大模型第一股 " 的故事,并缓解真实焦虑。
我也在杨植麟的决策中,看到 Kimi 在三个维度的 " 摸高 ":
一是算力摸高,从流量思维切换到价值思维。公开信息显示,Kimi 的 API 业务占比已经突破了 70%,与此前靠 C 端订阅模式大为不同。保老用户,拒新客,实则是将有限算力向高价值场景倾斜,避免泛 C 端流量挤占已是收入支柱的 B 端业务配额。
其代价也是显而易见。比如 " 优先保障存量用户 " 的执行标准不透明,哪些请求被优先响应、哪些被降级处理,一旦处理失策,都会稀释用户信任。
长远来看,Kimi 要完成从技术明星向成熟 AI 头部企业的转变,就必须夯实弹性算力池、分级响应机制、动态调度能力等基础设施。
二是定价摸高,Kimi 在进行从廉价自助餐到价值分层的压力测试。公告中提及的 " 拆分 Kimi 主权益与 Code 权益 ",既是应对算力短缺的短期调配,也可能预示着其定价体系重构的开端。
过去,无论用户写代码、查资料还是闲聊,都支付相同费用、消耗相同算力。当高算力消耗的 Code 用户占比上升,这种模式必然导致结构性错配。
Kimi 借此机会进行会员权益拆分,也是在按使用场景重新定价:轻度用户享受基础服务,重度用户为高价值能力支付溢价。
这是通过价值用户分层,在尝试争夺模型产品的定价权。目前,K3 收费标准已达每百万 Token 2.3 美元,虽低于海外顶尖模型,但已创下国产模型新高。
或许,Kimi 也想告别廉价模式,对外传递一个认知:高性能模型具备定价能力。接下来,大模型的竞争也将从 " 拼参数 " 转向 " 拼基础设施 "、" 拼成本定价 "。
这一步,比登顶榜单更难,也更接近商业本质。
第三,地位摸高,Kimi 从地缘变量到定价锚点的身份跃迁。
K3 发布后迅速引发全球关注。在独立 AI 模型评测机构 Artificial Analysis 发布的最新 " 智能指数(Intelligence Index)" 中,其综合得分达到 57 分,位列全球第三,仅次于 Claude Fable 5(60 分)和 GPT-5.6 Sol(59 分),领先 Claude Opus 4.8(56 分)。
这个成绩,也顺手打破了 " 开源落后闭源半代 " 的行业共识。
同时,K3 的影响力已溢出技术圈。美国科技投资机构将其视为 AI 发展的 " 拐点 ",认为高质量开源模型正加速能力扩散;加州大学伯克利分校计算机科学教授声称,K3 将中国开源模型与美国先进模型的差距,拉小至 2 到 3 个月。
资本市场的反应同样剧烈,K3 发布的首个交易日,英伟达单日市值蒸发约 1111 亿美元;摩根大通策略师在报告中直接称之为 "DeepSeek 2.0"。
这个加速度,才是改变定价逻辑的东西。
此外,月之暗面 ARR(年化收入)到 6 月已经接近 3 亿美元,海外增速 400%,涨价 60% 后收入反增,这三组数据叠加,表明 Kimi 的 " 开源 + 效率 " 模式可以规模化变现。
加上有消息披露,月之暗面正在寻求最快六个月在香港上市,估值在半年内从 43 亿美元飙升至 315 亿美元,涨幅超 7 倍。
这些都是资本市场在给一条非硅谷主流路线的 " 确权 "。它们为 " 能跑通单位经济模型的 SOTA" 下注时,也说明 Kimi 拥有了独立的估值逻辑,不再需要对标 OpenAI 或 Anthropic 来证明自己值多少钱。
但 K3 距离 AGI 还有很长的路。比如跑分,虽然 K3 只比 Fable 5 低了 3 分,但背后仍是不小的差距。
另外,Kimi 在技术报告里还承认了两个部署层面的缺陷:一是 K3 在训练中保留了完整的思考历史(thinking history),如果调用方没有正确地把之前的推理过程传回来,或者在会话中从别的模型切换到 K3,输出质量就会明显下降;
二是 K3 在任务模糊时会 " 过度主动 ",更倾向于替用户做决定。这种 " 自作主张 " 在需要精确执行的工程流程里,容易触发连锁错误。
还有一个容易忽视但极其重要的问题:幻觉。Artificial Analysis 在测评中特别指出,K3 的幻觉率比上一代 K2.6 反而有所上升。
某种程度上,K3 的光鲜与隐忧,是全行业算力供需失衡的缩影,也是中国 AI 产业在算力卡脖子、商业化未闭环、用户预期过高等重压下的集体阵痛。
这些 AI 厂商的每一次过载、每一次 " 熔断 ",都是中国 AI" 摸高 " 需要迈过去的坎儿。可以确定的是,一个新的竞争周期已经开启,大模型将从拼能力跨越到拼算力。
谁能在算法、算力储备等基建上建立优势,谁才能笑到最后,并将定义下一代 AI 公司的生存标准。
参考资料:
字母榜,《K3 发布 48 小时》
锦缎,《都怪 Kimi》