文 | 最话 FunTalk,作者 | 林书
最近这一个月,硅谷 AI 界可谓大招频出,GPT-5.6、fable5、Grok-4.5 接连问世。
一时间,国内开发者、程序员群体纷纷沸腾,各种关于 GPT-5.6 等前沿模型的讨论、测评此起彼伏。
尽管这个月也有 Kimi-K3 这样的新锐国产模型问世,但总的来看,国产大模型当前在一线开发者群体中,始终处于一种 " 叫好不叫座 " 的状态。

但与之形成反差的是,国内 AI 六小龙在营收方面的表现,却不怎么尽如人意:公开财报显示,智谱 2025 年营收 7.24 亿元,亏损却达到了 30 亿元以上,MiniMax 为 7900 万美元(约 5.7 亿元);月之暗面等其余四家尚未披露完整年营收。
即使头部企业,收入仍停留在数亿元量级。
相较之下,作为 AI 头部企业的 Anthropic,其 ARR 已经达到了约 600 亿— 700 亿美元,主要驱动力为 B2B API 及 AI Coding 场景 。
这不由得引出了一个尖锐的问题:
为何号称 " 便宜 "、" 调用量大 " 的国产模型,至今仍然叫好不叫座,在 AI Coding 等高价值的场景上,至今仍难以与国外顶尖模型正面抗衡?
最近,笔者在与多个一线开发者深入探讨此问题后,发现了一个很反直觉的事实:
国产大模型,某种程度上其实非常 " 贵 "。
也正是这样的 " 贵 ",让某些性能上有所突破的国产模型,难以真正展现自己的闪光之处。
01" 低价 " 的幻觉
提起国产大模型,很多人想到的都是 DeepSeek、Kimi、智谱这样的代表,而与之关联最紧密的标签之一,就是低价、便宜;
如果仅从 Token 单价上来看,国产模型与 GPT-5.6、fable5 等顶尖模型相比,确实有着不小的优势,拿 GLM-5.2 与 DeepSeek V4 举例:GLM-5.2 每百万 Token 输入 / 输出为 1.4/4.4 美元,DeepSeek-V4-Pro 为 0.435/0.87 美元;GPT-5.6 Sol 为 5/30 美元,Claude Fable 5 则为 10/50 美元。
但实际上,这种 " 低价 " 的印象,是一种圈外人长久的误区。
尤其在高强度的编程场景下,国产大模型的单价不但没有优势,甚至反而还比有套餐的 GPT、Claude 贵出好几倍。
李光(化名)是 AI 领域的一位科研工作者,由于工作需要,每天都要在 AI Coding 的场景下消耗几十亿 Token,在这样的消耗量下,如果用国产大模型,例如 GLM-5.2,整体的成本就会变得非常恐怖。

在交谈当天,李光消耗的 Token 已经接近 40 亿,这里可以稍微换算一下,倘若他用的是 GLM-5.2,成本大致是:(8639 万普通输入 × 1.4 美元+33.80 亿缓存输入 × 0.26 美元+1906 万输出及推理 × 4.4 美元)约为 1084 美元,按 1 美元兑 7.2 元估算,约合人民币 7800 元。
而让李光如此放开手脚烧 Token 的原因,就是因为他开了 GPT 的 CodeX 套餐,
这里简单解释一下 CodeX 套餐的具体形式,简单来说,它是针对编程场景推出的一款套餐:严格说来,它并非真正不限量,而是把 Codex 纳入 ChatGPT 订阅:Plus 为 20 美元 / 月,Pro 从 100 美元 / 月起,额度约为 Plus 的 5 倍或 20 倍;触顶后可购买 Credits 继续使用。
同样地,Anthropic 的 Claude Code 也有一套类似的套餐,具体形式是:Claude Pro 为 20 美元 / 月,Max 5x 和 Max 20x 分别为 100、200 美元 / 月;Claude 网页端与 Claude Code 共享每 5 小时及每周额度,触顶后可按 API 价格续用。
在这样的套餐兜底下,巨大的 Token 成本反而被抹平了。
对于国内的开发者来说,在高强度 AI Coding 场景下,每天消耗几十亿、上百亿 Token,是一个很普遍的常态。
小刘也是一个 AI Coding 的重度开发者,他在 Codex 上实际一周的花费是 300 元人民币,而这还是在没有公司报销的情况下。
但即使是这样的成本,对比国产模型,依然显得 " 便宜 " 了很多,因为同样 300 元,根本买不来 GLM 5.2 同等数量的 token。

在国内开发者看来,GPT 的 codex 套餐,是目前能买到的最便宜的 token,比智谱、kimi 便宜好几倍,这可能反直觉,但是事实就是国产模型在高强度的 Coding 场景下,性价比完全无法与之对比。
这里需要说明的是:codex 并非真正意义的不限量套餐,如果按最高档 200 美元算,一周大概有 20 亿额度。
但是,由于部分开发者会通过 " 中转站 " 等手段使用模型,某些模型的实际成本,会比官方渠道低很多,这就导致有时能以更低的价格,买到更多 Token,于是才有了 300 块能买 120 亿 Token 的现象。
实际上,国产模型在定价方面,不是没有推出过类似的套餐,但如果细究起来,这样的套餐,在限额方面,比起 codex 而言,存在着很大的限制。
02 国产定价之痛
国产大模型在定价方面的现状,可以用一句话来形容:
" 你以为你进的是自助餐的场子,但最后发现,商家还是按斤计费。"
举例来说,在套餐方面,国内的 Kimi、GLM-5.2:Kimi Code 分为 49、99、199、699 元四档,额度按周刷新;GLM Coding Plan 的 Lite、Pro、Max 每 5 小时分别约 80、400、1600 次 Prompt,每周约 400、2000、8000 次,且 GLM-5.2 高峰期按 3 倍扣额。
以阿里的 qoder 为例,根据笔者一位从事 B 端客户运维的朋友阿迷(化名)介绍:"qoder 曾经是国内最好用的 AI IDE,可惜它自己的新定价,把优势搞没了。"
在套餐方面:Qoder CN 个人 Pro、Pro+ 分别为 59、169 元 / 月,含 2000、6000 Credits;Teams 与 VPC 版分别为 99、199 元 / 席位 · 月,均含 3000 Credits,后者 50 席起售。
" 今年他们合并灵码调了定价后,就我知道的,至少都有二三十家放弃续费了。" 阿迷后来介绍道。
根据阿迷的测试,qoder 企业版 199 的套餐,按他的用法,3 天就没了,如果按重度开发者的用法,估计一天就没了。
同样地,在套餐方面,令国内用户感到五味陈杂的,还有 GLM-5.2。
按照开发者小薇的说法:"GLM-5.2 的套餐约等于没有,就算有套餐高峰期仍然限流,并且还存在‘背刺’用户的现象。"
按照 36 氪的报道:GLM-5.2 的套餐,之前比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。
2026 年 1 月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的 20%,每天早上 10 点放一点额度,几分钟就售罄。
说到底,国产模型在套餐、价格上的 " 吝啬 ",本质上是算力不足造成的窘迫。
根据 2025 年中国信通院、工信部的数据,中国现存的数据中心是 449 个,而美国则是 5427 个,在总算力方面,中国为 1053 EFLOPS,而美国则是 2400。
但这里的关键在于:美国那 2,400 EFLOPS 里,高端 GPU 占比极高;中国的算力里,大量是华为昇腾、寒武纪等国产芯片,单卡性能与 H100 仍有代差。
为应对愈发高涨的算力需求,2026 年 3 月开始,智谱、阿里云、腾讯云、百度在 Token 价格上集体涨价,涨幅从 5% 到 460% 不等。
说白了,国产模型的 " 低价 "、" 价格战 " 早已成为了过去式。
不是国产模型不想搞 buffet,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆,而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿 Token 的用法,这样的商业模式,很快会被击穿成本线。
而 OpenAI 和 Anthropic 的编程套餐,卖的是高净值企业客户—— Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。
在高算力的加持下,这套商业模式,本质是用 " 固定月费 " 换 " 长期锁客 ",客户质量高,ARPU 也相对较高,摊得平成本。
而相较之下,国内虽然有阿里这样的云巨头,但问题是:阿里云 FY2026 调整后 EBITA Margin 只有 7.5%,云智能集团虽然收入增长快,但利润并不丰厚。
并且,传统云厂商敢卖 " 不限量云服务器 ",是因为用户不是 24 小时满负载。一台 ECS,实际 CPU 利用率可能只有 10%,云厂商可以把一台物理机超卖给十个人。
但大模型推理不一样:来一个 token,就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷,云厂商的 HBM 显存、GPU 核心、电费全是刚性支出,没有任何超卖空间。
03 模型的 " 黄金三角 "
除了价格方面的因素外,对国内开发者来说,选择 Codex、Calude Code 的原因,无疑是其强大的编程性能。
然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。
在与多个开发者交谈后,笔者发现一个较为普遍的观点是:国产大模型,尤其是 GLM-5.2 等最新的模型,已经可以承接一些辅助性的、次要的任务,例如做测试和修改 bug。
但在较为复杂的、长时间的异步任务上,国产模型目前与 GPT、Calude 等顶尖模型,仍有较大差距。
开发者小张,今年 3 月份用过一次国产模型编程,用 GLM、qwen 和 GPT 对比同样的任务,只有 gpt 跑完了,且符合页面要求,那是一个多级、多列内容比对和结果生成的项目。
而另一个开发者小薇则表示,根据她的体验,Kimi 2.7 和 豆包 2.1 Pro 性能也尚可,但是它总的来说还是要弱一档(属于第二梯队),但总体而言也超过 Claude Sonnet 4.6 了。
目前,开发者群体中的普遍共识是:GLM-5.2 是第一个达到了 Opus 级别的国产模型。
它在执行真实的、复杂的、长时间的异步任务中,它是可用的、占据了一席之地的。
尽管在很多维度,例如世界知识上,其与真正的 Opus 模型仍有较大差距,但这不妨碍其成为国产模型的新高度。
但现实是:这刚刚崭露头角少数 " 尖子生 ",却被与性能无关的其他因素拖累了。
具体来说,这样的因素包括了缓存效率不高、高峰期仍然会限流等等,让开发者的实际体验很糟糕。
这就引出了当下模型对比中的另一个维度:稳定性。
在一线开发者、程序员的体验中,模型的选择,早已不是简单的性能对比,而是——
性能—价格—稳定性的 " 黄金三角 "。
在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。
近期,国内的 Kimi 发布了其最新的旗舰模型 K3:这是一款拥有 2.8 万亿参数、原生多模态和 100 万 Token 上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。

然而,在耀眼的分数与排名背后,开发者关切最多的,仍然是一个词:性价比。
在 K3 发布后,很多开发者表示,现在 Kimi 仍然很贵,与 Codex 相比没有性价比,且额度不够用,单看 API 价格,K3 也谈不上 " 白菜价 ":每百万 Token 缓存 / 输入 / 输出分别为 2/20/100 元;GPT-5.6 Sol 为 0.5/5/30 美元,K3 虽低于 Sol,却明显高于 GPT-5.6 Luna 的 0.1/1/6 美元。
且在使用 K3 的过程中,开发者表示还出现了 API 断连,甚至断了一上午的情况。
就目前的情况来看,国内开发者不是不愿意为国产模型付费,而是国产模型目前因算力紧、成本高,目前开不起 Codex 这样具有性价比的套餐,只能开看似自助餐,实则限量的 " 大众点评套餐 "(类似智谱 的 Coding Plan)。
而套餐的体验不稳定、性价比模糊,导致用户使用过难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。
以上这些,并非我们要长他人志气,灭自己威风,只是想提示一种风险。
目前,国产模型在追赶 GPT、Claude 的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的,远不止性能这一座高山。
我们需要的是等待,等到国产算力基座大规模量产了,在技术、价格、稳定性方面,形成合力了,我们的产品就能撑起用户的期待。