关于ZAKER Skills 合作
智东西 2小时前

新模靠边站,谷歌 Gemini 4 要来了!公司史上最大炼模启动

智东西

编译 | 杨京丽

编辑 | 李水青

智东西 7 月 22 日消息,今天凌晨,谷歌发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber 三款模型,重点提升 Agent 工作流所需的Token 效率、响应速度和运行可靠性

谷歌发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber(图源:X)

其中,Gemini 3.6 Flash 面向编程、知识工作和多模态任务,在第三方评测机构 Artificial Analysis 的 Intelligence Index(智力指数)中,其任务 Token 消耗量比 3.5 Flash少 17%,在 DeepSWE 测试中的输出 Token 消耗最多减少约 65%

Gemini 3.5 Flash-Lite 主打低延迟和高吞吐量,生成速度达到每秒 350 个输出 Token,在 Agent 工作流中较前代的 Flash-Lite 模型也有较大提升。

Gemini 3.5 Flash Cyber 则专门用于发现和修复网络安全漏洞,将其与 CodeMender 代码安全 Agent 配合使用,性能已达到前沿模型的竞争水平,与 Mythos 5 和 GPT-5.6 Sol 能力相当,不过暂不面向普通开发者开放。

目前,在 Artificial Analysis 榜单上,Gemini 3.6 Flash 速度测评成绩优秀,但智力和成本的优势相对不明显:该模型的 Intelligence 得分只有 50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,连 Meta 的Muse Spark 1.1也排在它前面;其单任务成本达到 0.50 美元(约合人民币 3.39 元),较 DeepSeek、MiniMax、GLM、Muse Spark、Grok 等模型更贵。

Gemini 3.6 Flash 在能力、速度和成本上与其他模型对比(图源:Artificial Analysis)

作为昔日大模型 " 御三家 " 之一,谷歌此次最突出的优势仍然是速度。目前,Gemini 3.5 Flash-Lite 和 Gemini 3.6 Flash 在输出速度上,位列榜单前两位

Gemini 3.5 Flash-Lite 和 Gemini 3.6 Flash 位列模型输出速度榜前两位(图源:Artificial Analysis)

对于等了两个月的用户来说,这次发布多少有些 " 等错了人 "。今年 5 月,谷歌 CEO 桑达尔 · 皮查伊(Sundar Pichai)在 I/O 大会上预告,Gemini 3.5 Pro 将在 6 月推出;如今 7 月已经过半,用户还是没有等来 3.5 Pro。

对于这款迟到的 Gemini 3.5 Pro,谷歌称该模型正在与合作伙伴测试,将在准备就绪后尽快发布。与此同时,谷歌提前预告Gemini 4,称已启动公司迄今规模最大的预训练任务。鸽了我们两个月的谷歌又画了两张新 " 饼 ",也算是 " 不负众望 "。

一、3.6 Flash:输出 Token 最多减少 65%,编程、知识工作提升明显

Gemini 3.6 Flash 基于开发者和企业客户对 3.5 Flash 的反馈改进。在处理多步骤工作流时,新模型需要的推理步骤和工具调用次数更少,同时减少了输出冗余。

3.6 Flash 的输入价格为每 100 万个 Token 1.5 美元(约合人民币 10.2 元),输出价格为每 100 万个 Token 7.5 美元(约合人民币 51 元),输出价格低于 3.5 Flash,输入价格不变。

3.6 Flash 大幅降低了每项 Agent 任务的运行成本。在 DeepSWE v1.1 测试中,3.5 Flash 平均每项任务消耗约 27.6 万个输出 Token,3.6 Flash 降至约 9.7 万个,降幅接近 65%;在 Artificial Analysis Intelligence Index 中,两款模型的平均输出 Token 消耗分别约为 2.8 万个和 2.3 万个,Gemini 3.6 Flash 的 Token 消耗量降低约 17%。

Gemini 3.6 Flash 和 Gemini 3.5 Flash 任务输出 Token 对比(图源:谷歌)

在软件工程 Agent 评测 DeepSWE v1.1 中,3.6 Flash 得分为 49%,高于 3.5 Flash 的 37% 和 3.1 Pro 的 12%;在机器学习工程测试 MLE-Bench 中,3.6 Flash 得分为 63.9%,领先 3.5 Flash 的 49.7% 和 3.1 Pro 的 42.6%。

知识工作测试 GDPval-AA v2 中,3.6 Flash、3.5 Flash 和 3.1 Pro 的得分分别为 1421、1349 和 965;在测试 Computer Use(计算机操作能力)的 OSWorld-Verified 中,三者得分分别为 83.0%、78.4% 和 76.2%。Computer Use 现已成为 Gemini API 和 Gemini Enterprise 中的内置客户端工具。

3.1 Pro、3.5 Flash 和 3.6 Flash 其他能力对比(图源:谷歌)

同时,谷歌还展示了模型的应用案例,Gemini 3.6 Flash 能够更高效、准确地分析金融数据和电话会议记录、通过多 Agent 协作执行代码迁移、为 3D 工作流开发照片纹理提取工具,以及结合 tldraw 离线编辑器创建交互式主题设计工具。

在代码迁移任务的对比测试中,Gemini 3.6 Flash 的规划耗时为 20 秒,低于 3.5 Flash 的 24 秒;执行迁移的时间则由 2 分 08 秒缩短至 1 分 20 秒,整体耗时减少约 34%。根据案例展示的信息,3.6 Flash 生成了更详细、结构更清晰的代码审计与验证文档,覆盖数据模型、API 接口、业务逻辑、UI 组件等多项针对性验证任务。

Gemini 3.5 Flash 和 Gemini 3.6 Flash 在代码迁移任务中耗时对比(图源:谷歌)

多家早期客户也给出了反馈。设计软件公司 Figma 认为,3.6 Flash 在质量、速度和成本之间取得了较好平衡,可以加快原型探索和迭代;法律 AI 公司 Harvey 称,该模型在文档起草和审查任务中平均快 12%;开发工具公司 JetBrains 称,其低推理等级下的编程性能较上一代 Flash 提高了 10% 至 20%。

安全方面,3.6 Flash 加强了针对化学、生物、放射性与核风险以及网络攻击滥用的前沿安全防护。谷歌称,这些措施提高了模型抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。

二、3.5 Flash-Lite:每秒输出 350 个 Token,部分测试超过 3 Flash

Gemini 3.5 Flash-Lite 是 Gemini 3.5 系列中速度最快、价格最低的模型,主要面向 Agent 搜索、文档处理等强调低延迟和高吞吐量的任务。

根据 Artificial Analysis 的数据,该模型每秒可以生成 350 个输出 Token。其输入和输出价格分别为每 100 万个 Token 0.3 美元(约合人民币 2 元)和 2.5 美元(约合人民币 17 元)。

开发者可以根据工作负载调整模型的思考等级:在大规模、低成本任务中选择 minimal 或 low 等级,在需要处理多步骤子 Agent 任务时启用更高等级。3.5 Flash-Lite 同样内置了 Computer Use 工具。

与 3.1 Flash-Lite 相比,3.5 Flash-Lite 在 Agent 终端编程测试 Terminal-Bench 2.1 中的得分从 31% 升至 54%;在长上下文测试 GDM-MRCR v2 中,得分从 60.1% 升至 72.2%;在知识工作测试 GDPval-AA v2 中,得分从 642 升至 1140。

Gemini 3.1 Flash-Lite 与 Gemini 3.5 Flash-Lite 对比情况(图源:谷歌)

3.5 Flash-Lite 在部分测试中还超过了定位更高的 3 Flash。在 SWE-Bench Pro 中,Gemini 3.5 Flash-Lite 和 Gemini 3 Flash 两款模型得分分别为 54.2% 和 49.6%;在 OSWorld-Verified 中,两者得分分别为 74.0% 和 65.1%。

Gemini 3 Flash 和 Gemini 3.5 Flash-Lite 对比情况(图源:谷歌)

美国金融科技公司 Ramp 认为,Gemini 3.5 Flash-Lite 在票据提取任务中较好地平衡了准确率、延迟和成本。

美国金融公司 Ramp 对 Gemini 3.5 Flash-Lite 的评价(图源:谷歌)

三、网络安全模型:搭配 Agent 使用,暂不面向普通开发者开放

第三款模型 Gemini 3.5 Flash Cyber 基于 3.5 Flash 微调,专门用于发现、验证和修复网络安全漏洞。相比体量更大的模型,其 Token 价格更低,适合规模化检查代码安全问题。

该模型将与谷歌代码安全 Agent CodeMender 配合使用。CodeMender 会同时运行多个 3.5 Flash Cyber Agent,最后将不同 Agent 的分析结果合并成一份报告。

在 CyberGym 测试中,CodeMender 最多调用 5 次模型时,3.5 Flash Cyber 得分为 83.2%。该模型在测试中的表现接近 OpenAI 和 Anthropic 的前沿模型,Anthropic Agent 内的 Mythos Preview 得分为 83.1%,OpenAI Agent 内的 GPT-5.6 Sol 得分为 83.6%,Anthropic Agent 内的 Mythos 5 得分为 83.8%,OpenAI Agent 内的 GPT-5.5-Cyber 得分为 85.6%。

Gemini 3.5 Flash Cyber 在 CyberGym 测试中的表现(图源:谷歌)

考虑到漏洞发现和修复技术具有明显的双重用途,谷歌暂不向普通开发者开放 3.5 Flash Cyber。该模型近期将通过 CodeMender 启动小范围试点,仅供政府机构和可信合作伙伴使用。

四、两款模型均已上线,3.5 Pro 仍在测试

目前,Gemini 3.6 Flash 和 3.5 Flash-Lite 已经通过 Google AI Studio、Android Studio 及 Gemini API 向开发者开放,其中 3.6 Flash 还进入了 Google Antigravity。

企业客户可以通过 Gemini Enterprise Agent Platform 使用这两款模型,3.6 Flash 同时接入了 Gemini Enterprise 应用。普通用户可以在 Gemini 应用中使用两款模型,3.5 Flash-Lite 还将逐步接入谷歌搜索。

Gemini 3.5 Pro 目前仍处于合作伙伴测试阶段,谷歌计划在准备完成后扩大开放范围。

结语:Gemini 从追求单次性能,转向降低 Agent 总成本

谷歌此次更新 Flash 系列,重点转向降低 Agent 的实际运行成本。Gemini 3.6 Flash 显著减少了完成任务所需的输出 Token、推理步骤和工具调用次数,Gemini 3.5 Flash-Lite 则进一步提升了生成速度。对于需要大规模部署 Agent 的企业和开发者来说,更低的成本和更快的响应速度仍具有实际吸引力。

不过,从 Artificial Analysis 等第三方榜单来看,Gemini 的 Flash 系列模型能力目前难以保持领先。上周,月之暗面发布 Kimi K3,其 Intelligence 得分仅落后于 Claude Fable 5 和 GPT-5.6 Sol,在前端编程测试中甚至排到了榜首。

国产模型已经从跟随者变成全球前沿模型竞争中的重要力量,谷歌面对的对手也远不止 OpenAI 和 Anthropic。至于谷歌能否重回昔日 " 御三家 " 的牌桌中,恐怕还要看已经延期的 Gemini 3.5 Pro,以及刚刚开始预训练的 Gemini 4。

来源:谷歌、X、Artificial Analysis

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容