文 | AI 唱反调
大模型价格战,进入了暗战阶段。
9 月 2 日,谷歌发布 Gemini 3.8 Flash,单价一分没涨:输入每百万 token 0.75 美元,输出 3.75 美元。Artificial Analysis 当天的实测却发现,完成同一个任务的总成本涨了 40% ——模型每个任务多消耗了 30% 的输出 token。

Gemini 3.8 Flash 在 DeepSWE 上追到离 Opus 5 只差 0.3 分,价格不到对方 1/6,代价是单任务 token 消耗上升 30%、明年初单价翻倍。Agentic 推理越多,账单越厚——成本竞争的口径正在从 " 每 token 价格 " 切换到 " 每任务成本 "。
一款什么样的模型
先把公开资料能确认的规格摆清楚。
Gemini 3.8 Flash 是谷歌 43 天里的第三款 Flash:3.6 在七月下旬,3.7 在八月十三日,3.8 在九月二日。皮查伊在财报电话会上说过,Flash 的目标是尽量接近月更节奏。
基准成绩集中在四类任务上:DeepSWE v1.1 长周期软件工程 73.7%,距离 Claude Opus 5 的 74.0% 只差 0.3 分;HLE-Verified 综合推理 54.9%,高于 Opus 5 的 54.4% 和 GPT-5.6 Sol 的 54.5%;Vals 金融智能体 61.4% 排第一;生成速度约 305 token/ 秒,是独立机构测过最快的商用模型。

模型现已进入 Gemini App、AI Studio 和 Antigravity 编程平台,Cursor、Vercel 等开发工具在发布当天完成接入。
技术机制:为什么会 " 多用 30% 的 token"
这次升级的核心设计,谷歌自己的表述是模型会 " 更努力地完成任务 "。
拆开讲就是 agentic 推理深度的提升。面对复杂任务,模型执行更多推理步骤、更频繁地迭代调用工具。数据流的变化大致是这样:

Artificial Analysis 测出的数字链条是完整的:单任务输出 token 增加约 30%,折算成单任务总成本上升约 40%。即便涨完,单任务约 0.58 美元的成本,仍然落在 " 智能 - 成本 " 性价比前沿上——高推理档综合智能指数 59 分,比上代提高 3 分。
另一层价格变化在明年:优惠价到期后,单价将翻倍至输入 1.50 美元、输出 7.50 美元。用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。谷歌同时保留 3.7 Flash 作为低成本选项,承诺继续支持。
为什么是现在
Flash 系列的升级节奏,指向的是开发者入口的争夺。
编程 Agent 和自动化工作流是当前 token 消耗增长最快的场景,也是各家 API 收入的主战场。这个场景的采购逻辑很现实:单位智能成本谁低用谁,迁移成本极低。DeepSWE 追到离 Opus 5 只差 0.3 分、价格不到六分之一,等于直接把 " 旗舰级编程能力 " 的商品价格打穿了一个量级。
同天发布的 Gemini 3.8 Flash Cyber 则补了另一条战线:CWE-Bench 漏洞修复 47.2%,与领跑的 Fable 5 基本持平;Chrome 安全团队实测其有效补丁产出是更大商业模型的 2.6 倍;Wiz 内部渗透测试召回率高出 7.5 到 9.7 个百分点,同等成绩花费仅为竞对的 1/2.3 到 1/5.2。这个版本不公开售卖,只通过 Fairwind 计划向约 650 家受信机构开放——与 Anthropic 把 Mythos 5.1 锁进可信访问计划的门控逻辑一致。前沿网安能力正在变成需要资质审核的战略资源。
合理推演是,谷歌的账算在规模上:Flash 承担开发者生态的走量任务,把使用习惯和工具链锁定在自家平台上,Pro 级别的利润款可以等能力差距真正拉开再发。这也解释了为什么六月预告的 Gemini 3.5 Pro 至今没有发布—— Flash 太强,Pro 的价格锚点立不住。
边界要摆上桌
基准口径的边界需要先讲清。
官方主打的四个基准全部领先,但第三方核对了完整榜单后,画面并不均匀。开放式 Agent 任务是明显短板:Terminal-Bench 4.0 上 Opus 5 拿到 51.8%,3.8 Flash 只有 19.1%;OSWorld 电脑操作 75.4% 对 59.0%。Harvey 法律基准上 10.0% 的 " 领先 ",实际是全榜模型集体不及格下的相对值。
规律大致是:边界清晰、终点明确的专业任务,它能贴着旗舰打;需要自主规划下一步的开放任务,差距会被拉开。沃顿教授 Ethan Mollick 的初步评价是 " 一个很好的 Flash 模型,但并不等于前沿模型 "。

写在最后
这次发布可以确认的产品事实是:Flash 系列的迭代周期压缩到三周级,能力触及旗舰边缘,网安版本进入资质门控。
更值得注意的是成本竞争口径的迁移。当各家每 token 单价逐渐咬平," 完成一个任务烧多少 token" 就成了新的定价杠杆——推理更深、步骤更多的模型天然更贵,即便价目表一动不动。Anthropic 两天前把缓存读取价砍了 75%,打的也是同一本账。
对开发者的实际建议只剩一条:选型时盯住单任务成本,而不是单价。价格战的第二阶段,比的是谁的账单更会 " 藏 "。