文 | 字母 AI
Gemini 4 可算来了,连名字也换了:这次的旗舰不叫 Pro,叫 Argon。
从谷歌公布的成绩看,Gemini 4 Argon 在知识工作方面表现抢眼,多项测试超过了 OpenAI 和 Anthropic 的旗舰模型。
它主打一个知识面广,从金融、法律到数学、科学,都有不错的表现。
谷歌还确认,9 月 15 日在 LMArena 上亮相、表现接近 GPT-6 Astra 的 "3.8 Flash",其实就是 Gemini 4 Argon。
曾与 Anthropic、OpenAI 并驾齐驱的谷歌,此前因 Gemini 3.5 Pro 表现未达预期,加上内部人事动荡,一度掉队。
这一次,谷歌能靠 Gemini 4 Argon 翻盘吗?
Gemini 4 Argon 性能如何?
据谷歌介绍,Gemini 4 Argon 采用了公司迄今规模最大的预训练。这也是谷歌时隔 10 个月推出的新一代旗舰。
和其他旗舰模型一样,它瞄准的是长程编程任务、企业级知识工作和网络安全防御。
在谷歌公布的 18 项基准测试中,Argon 拿下 12 项第一、1 项并列第一;GPT-6 Astra 拿下 3 项第一、1 项并列第一,Claude Opus 5.5 则拿下 2 项第一。
至少在这份成绩单上,谷歌的领先项目数超过了 OpenAI 和 Anthropic。

在衡量知识工作能力的 Vals Index 中,Argon 以 68.9% 的成绩排名第一;在 Zapier 的业务自动化测试 AutomationBench 中,它以 51.3% 领先,Opus 5.5 和 Astra 分别为 42.5% 和 41.4%。
在金融研究测试 Vals Finance Agent v2 中,Argon 得分 65.4%;在法律任务测试 Harvey Legal Agent 中,它得分 19.6%,Astra 为 5.4%,约为它的四分之一。
在长视频理解测试 LVBench 中,Argon 得分 91.7%;在 GraphWalks 的长上下文图检索测试中,得分 84.2%。
网络安全方面,Argon 与 Astra 在 CWE-bench v1 中以 68% 并列第一。在 Gray Swan 的提示注入测试中,针对 Argon 的攻击成功率仅为 0.7%,是参测模型中最低的,Astra 则为 8.5%。
成绩单很漂亮,但 Argon 并非处处领先。
它的短板,出现在部分软件工程、终端操作和科学任务上。
在 FrontierSWE v2 中,Argon 得分 55.0%,Astra 为 65.5%;在 Terminal-Bench Science 0.1 中,两者分别为 57.6% 和 68.1%。两项测试中,Argon 都落后 10.5 个百分点。
在衡量 Agent 终端操作能力的 Terminal-Bench 4.0 中,Argon 得分 57.4%,也低于 Opus 5.5 的 66.4% 和 Astra 的 58.2%。
这些结果说明,Argon 在知识工作上有优势,但面对一些需要持续操作、执行的任务,仍未追上对手。
Argon 的另一个特点是少说没把握的话。在 Artificial Analysis 的 AA-Omniscience 测试中,它的幻觉率最低。
在未能答对的问题中,Argon 只有 15% 给出了错误答案,其余选择承认 " 不知道 "。这一指标衡量的是模型有多爱 " 瞎编 ",不等于答题正确率。
作为对比,GPT-6 Astra 在不同推理设置下的幻觉率为 45% 至 51%,Opus 5.5 和 Fable 5.1 在最高推理设置下分别为 59% 和 73%。

GPT-6 Astra 此前自报 ARC-AGI-3 成绩达到 99.9%,随后就引发了对测试可信度的质疑。
Gemini 4 Argon 发布不到一小时,也有外媒质疑其评分,称部分试用过的谷歌员工认为,分数高于实际表现。
在 Artificial Analysis 公布的智能指数图中,Argon 得分 53 分,与 Astra、Claude Fable 5.1 同分,低于 Opus 5.5。

价格倒是颇有吸引力。尝鲜期内,Argon 每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元;缓存命中的输入价格再降 95%,为每百万 token 0.10 美元,低于 Astra 和 Opus 5.5。
尝鲜期结束后,标准价格将恢复至每百万输入 token 4 美元、输出 token 20 美元,与 Opus 5.5 相同。
Pro 去哪了?
Argon 意为氩,是一种化学性质稳定、很少与其他物质发生反应的稀有气体,算得上元素周期表里的 " 宅男 "。
谷歌称,新的 " 元素命名法 " 是为了将旗舰架构与更轻量的 Flash 系列区分开。
有意思的是,Argon 首次公开露面时,却披着 Flash 的外衣。9 月 15 日,它以 "gemini-3.8-flash" 的名字出现在 LMArena 上。
不少网友拿它做鹈鹕测试,发现效果与 Astra 相差无几,纷纷感叹:Flash 都这么强了,Pro 还了得?如今谜底揭晓,他们提前试到的就是旗舰。
除了性能,谷歌这次还着重介绍了 Argon 的安全设计。此前,谷歌与 OpenAI、Anthropic 一样,都曾曝出模型被越狱的问题。
这一次,谷歌为首批用户提供了一个移除网络安全护栏的特别版本。
谷歌称,这样做是为了减少模型误拒绝正常安全研究请求的情况,让防御人员能够检查潜在攻击入口、发现并修补漏洞。
谷歌还介绍了 " 监控内部激活 " 的安全手段,用来识别模型推理过程中的风险信号。
这意味着,安全检查除了筛查输入,还会监控模型的思维链和内部激活信号。
一旦检测到模型正在生成进攻性网络行为的相关内容,运行时监控系统就会中断生成。
据谷歌介绍,Argon 已经在公司内部干起了活。
它帮助量子计算团队优化编译流程,将时空开销较已发表的基线降低 40%;分析跨数据中心的性能数据并修补问题,释放超过 300 TiB 内存;将 C/C++ 代码迁移至 Rust,涉及 re2、libgav1,以及 80 万行的 Fuchsia OS Zircon 内核。其中,libgav1 的 3.2 万行 SIMD 代码被改写为安全的 Rust 代码后,运行速度达到原 Rust 版本的 2.7 倍,输出结果保持一致。
9 月 14 日,谷歌还曾联合马里兰大学、弗吉尼亚大学发布论文《Dream-RSI》。
这篇论文提出,将 Agent 过去的搜索历史保存为一棵 " 发现树 ",让它沿着这棵树反复 " 做梦 ",离线尝试不同的探索策略,无须重新运行真实实验。
在六个数据集上,这种方法将发现型 Agent 的调用次数降至原来的约 1/162,减少了探索过程中的调用开销。
Argon 也采用了这套方法,以提高训练效率。
谷歌这一阵到底去哪了
自 Gemini 3 Pro 发布以来,谷歌已近 10 个月没有推出新一代旗舰。
2026 年 2 月 19 日,谷歌推出了 Gemini 3.1 Pro 小幅更新,但原定 6 月发布的 Gemini 3.5 Pro 迟迟未能通过内部测试。
当时,行业竞争的重心已转向编程和 Agent,Gemini 3.5 Pro 却未能在多文件代码重构、自主 Agent 执行等任务中,展现出相对 OpenAI 和 Anthropic 的明确优势。
7 月 17 日,外媒报道称,Gemini 3.5 Pro 因编程表现不达标,将推迟数月发布。当天,Alphabet 股价一度下跌 4%。
8 月,DeepMind 迎来人事调整。哈萨比斯卸任 DeepMind CEO,转任 Alphabet 首席科学家;杰夫则离开首席科学家岗位,与朋友创业。
科雷 · 卡武克丘奥卢(Koray Kavukcuoglu)接掌 DeepMind,直接向皮查伊汇报。外媒将其视为谷歌近年来最大的一次 AI 领导层调整。
这段时间,谷歌主要靠 Flash 系列维持声量,同时启动 Fairwind 计划,与多家网络安全公司合作。
9 月 24 日,科雷表示,Gemini 4 已进入后训练阶段,将尽快发布,不必等到年底。
如今,Gemini 4 Argon 终于来了。我的谷歌会员要不要续,等真正用上它再说。