来源:环球市场播报
Alphabet 的谷歌已开始推出备受期待的旗舰人工智能模型 Gemini 4 Argon,但公司内部对于该模型在编程等关键领域的实际表现存在质疑。
周三,谷歌向一小批可信赖的网络安全合作伙伴开放了该模型,并表示将在进行更多测试后扩大使用范围,首先对付费用户开放。公司称,Gemini 4 在多项基准测试中取得了领先成绩,包括在一项衡量安全能力的测试中击败了 OpenAI 的 Astra 模型。
不过,一些内部人士表示,这些指标并不能反映全貌。据直接了解这项工作的知情人士称,尽管 Gemini 4 在衡量模型效能的基准测试中表现出色,但在员工实际使用时,效果则没有那么出色,某些编程任务尤其如此。因讨论内部事务,这些人士要求匿名。
Alphabet 股价在公司发布消息后的盘后交易中上涨约 1.7%。但在常规交易时段尾盘,媒体报道了公司内部员工对该模型持怀疑态度后,Alphabet 股价回吐了周三早先的部分涨幅。
谷歌近期一直致力于开发能够与 OpenAI 和 Anthropic PBC 相媲美的模型。知情人士透露,公司原计划在 6 月发布一个叫 Gemini 3.5 Pro 的新版本,但最终放弃了该项目。
谷歌表示,说 Gemini 4 在编程等领域表现不佳并不准确,并让参考谷歌 DeepMind 负责人 Koray Kavukcuoglu 上周的讲话,他当时对该模型的表现感到鼓舞。
" 我对团队充满信心,"Kavukcuoglu 在科技新闻网站 The Information 主办的一次会议上说。" 在我看来,我们肯定始终会处于行业前沿。"
谷歌内部看法不一。一些员工认为,Anthropic 的 Fable 和 OpenAI 的 Astra 模型进步速度比 Gemini 更快。这些人认为,即使 Gemini 4 发挥到最佳水平,在某些方面仍然会落后于这些模型。而另一些员工的观点则是,即将推出的版本已经赶上了领先的人工智能实验室。
一位熟悉模型开发的谷歌员工表示,公司内部 " 普遍认为 "Gemini 4 处于技术前沿。该员工称,公司已对模型进行了严格的测试,并否认模型在应对复杂的、现实世界的编码任务方面存在问题。
谷歌迫切需要 Gemini 4 取得成功。从谷歌主要盈利引擎 —— 搜索功能中的人工智能答案,到地图、Gmail 和 Chrome 浏览器,这个模型的不同版本支撑着几乎所有谷歌产品。这些产品的用户数量都超过 10 亿,这正是谷歌的一些竞争对手所不具备的分发优势。
但 OpenAI 和 Anthropic 正逐渐从销售 AI 模型转向打造自己的产品,包括编程智能体。如果谷歌无法提供尖端模型,其竞争对手可能会有更多时间说服消费者、开发者和企业,让他们相信搜索和软件的未来应该运行在它们的平台上。
针对相关提问,谷歌回应称,尽管其上一款 Pro 模型是 2 月发布的,但此后公司的 AI 产品实现了增长,包括企业版 Gemini、面向消费者的聊天机器人应用以及谷歌搜索中的 AI 模式,后两者的用户数量均已超过 10 亿。
Gemini 3
去年 11 月,谷歌发布了广受好评的 Gemini 3,该模型被广泛视为谷歌追赶 OpenAI 和 Anthropic 的一个转折点。今年 5 月,谷歌在 I/O 开发者大会上宣布了 Gemini 3.5 Pro,并承诺将于次月发布, 但未能如期推出。熟悉情况的知情人士称,公司已经放弃了 3.5 Pro。
除了拖累谷歌的 AI 雄心之外,这一决定很可能也让该公司损失了大量时间和金钱。 行业研究分析师 Mandeep Singh 表示,构建这样一个模型所需的训练可能需要花费高达 4 亿美元。而聘请高薪人工智能研究人员则可能进一步推高成本。
如今,谷歌在 Gemini 4 的开发上遇到了诸多挑战。熟悉该模型内部评估的人士透露,其编码能力表现不均衡。其中一人表示,Gemini 并不擅长前端设计,而前端设计决定了应用程序和网站的外观和用户体验。这对于谷歌来说可能是一个严重挫折,因为谷歌一直在努力在竞争激烈的 AI 编程工具市场中与对手抗衡。
此外,另一位熟悉开发情况的知情人士说,这是一个非常庞大的模型。通常来说,大型模型的运行成本很高,这可能会对谷歌的利润率带来压力。
‘ Benchmaxxing ’
专家表示,谷歌可能正受到行业内过度关注基准测试的倾向的影响 —— 这种现象被称为 "benchmaxxing",即工程师们专注于获得高分,而不是打造好的产品。人工智能实验室之所以会这样做,是因为客户通常会根据基准测试得分来评判模型。两位熟悉该模型的人士表示,Gemini 4 似乎也受到了这种倾向的影响。
人工智能初创公司 Surge AI 的创始人 Edwin Chen 表示,依赖基准测试可能会促使实验室专注于打造擅长用某种特定语言编写代码的模型,而不是开发真正易用或设计良好的应用程序。
他说:" 打个比方,‘哦,我的孩子 SAT 考得真不错’ —— 但 SAT 成绩并不能转化为实际的表现。这是一个危害极大的问题。"
据一位熟悉情况的知情人士称,Gemini 4 的确拥有一些优势,例如,该模型在理解文本以外的输入方面表现出色,例如从视频中提取元数据。此外,该模型在安全性、网络安全以及清晰自然的沟通能力方面也有优势。
谷歌内部已有不满的情绪。此前接受采访的研究人员将此归咎于试图将 AI 技术融入谷歌几乎所有产品的官僚做法。他们表示,不断变化的要求和优先事项已经让专注于一套连贯的战略成为难事。
与此同时,包括传奇工程师 Jeff Dean、诺贝尔奖得主 John Jumper 和参与发明支撑此次 AI 热潮关键技术的 Noam Shazeer 等一批明星 AI 研究人员离开了谷歌。8 月,长期领导谷歌人工智能研究的 Demis Hassabis,转任董事长,并将 DeepMind 的日常运营交给了他的长期副手 Kavukcuoglu。
谷歌周三表示,Gemini 4 专为软件工程、金融、法律和网络安全等领域的复杂长任务而设计。公司称,Gemini 4 可生成的回复长度超越其前代产品,一次最多可处理 100 万个词元,也就是大约 75 万个单词。
谷歌正努力追赶,而竞争对手也在加速前进。尽管此前发生一系列 AI 智能体侵入外部系统的事件后,曾有放慢部分前沿模型的开发速度的讨论。本月早些时候,Meta Platforms Inc. 发布了 Muse 人工智能体,称其可以完成网上购物和预约等日常任务。这款应用迅速登上下载排行榜前列。