关于ZAKER Skills 合作
钛媒体 18分钟前

Opus 5 反超 Fable 5,Anthropic 的定价牌局被打乱了?

7 月 25 日凌晨 1 点,Anthropic 发布了 Claude Opus 5。如果只看名字,你会以为它是 Opus 4.8 的继任者,Anthropic 产品线中比 Sonnet 强但比 Fable 弱的中间型号。

但一看数据就会发现,这款定价 $5/$25(每百万输入 / 输出 token)的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键基准测试上,把定价 $10/$50 的 Fable 5 给超了。而它的成本,只有 Fable 5 的一半。

Anthropic 在官方公告里表示:"Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price",意思是接近 Fable 5 的智能,价格减半。但他们自己发布的基准测试图表显示,Opus 5 在至少四项核心评测中明确领先 Fable 5,而且是在更低的成本下做到的。

被 " 次旗舰 " 反超的 " 旗舰 "

先看编程能力。Frontier-Bench v0.1 是当前最直接映射企业开发团队实际工作的基准测试之一,让模型自己在终端里写代码、跑代码、调试多文件变更。Opus 5 拿到了 43.3%,Fable 5 是 33.7%。将近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。

在 CursorBench 3.2 上,Opus 5 在最高推理强度下达到 Fable 5 峰值成绩的 94.5%,单次任务成本只有一半。Anthropic 还宣称,在 high、xhigh 和 max 三个推理等级上,Opus 5 在同成本下的性能都超过了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 评测后确认:"Claude Opus 5 在调试和根因分析方面以一半成本达到了接近 Fable 级别的性能。"

在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,Fable 5 是 87.4%。十次搜索有九次以上能独立搞定。计算机使用(OSWorld 2.0)上,Opus 5 在约三分之一成本下就超过了 Fable 5 的最优成绩。企业业务流程自动化(Business Workflows)方面,Opus 5 拿到 26%,Fable 5 只有 17.4%。

科学领域同样不弱。Opus 5 在有机化学任务上比 Opus 4.8 高出 10.2 个百分点(包括从光谱数据推断分子结构),在蛋白质相关任务上高出 7.7 个百分点(包括预测序列变异对功能的影响)。在号称 " 人类最后考试 " 的 Humanity's Last Exam 上,开启工具后 Opus 5 拿到 64.7%,Fable 5 是 63.9%(不开工具时分别为 56.3% 和 56.5%),差距不到一个百分点。

但真正让整个 AI 研究圈停下滚动的,是 ARC-AGI 3 的成绩。

ARC-AGI 3 是 Fran ois Chollet 设计来衡量 " 流体智能 " 的基准。它不是让模型回忆训练数据里见过的东西,而是把它扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。人类能完成 100% 的任务。今年 3 月 ARC Prize Foundation 发布这个基准时,最强 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 只有 1.5%。

Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。

这个数字的意义远超任何编程或搜索基准。ARC-AGI 3 奖励的不是 " 做过类似的事所以能做 ",而是 " 从没训练过也能做 "。30.2% 意味着 Opus 5 确实在通过交互来推导陌生的规则体系,而不只是模式匹配。Vellum AI 的基准分析文章直言:" 这个数字让所有人都停下了滚动。"

它不只是分数高

基准数字告诉我们 Opus 5 考了多少分。但 Anthropic 公布的案例告诉了我们是它怎么考到这些分的。

Anthropic 公布了一个 3D 建模任务,只给模型一张机械零件的设计图纸,要求它自主编写代码重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,没有任何模型能完成这个任务,即使人工提前搭好开发框架、给出详细方案,模型依然会出错。Opus 5 不仅完成了全过程自主闭环,还自己搭建了配套的测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

在没有任何人工干预的情况下,自主完成了一个完整的工程验证循环,设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正、再次测试、通过。

Zapier CEO Wade Foster 透露,团队用 Opus 5 处理客户健康度原始表格,要求 AI 独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。" 以前的模型没有能完整跑通这条流程的,"Foster 说,"Opus 5 做到了 100% 完整交付。"

Box CTO Ben Kus 给出了量化对比:Opus 5 在专业企业内容处理上整体比 Opus 4.8 提升 8%,数据分析工作流提升 11%,尽职调查提升 17%。一家金融建模团队的评估负责人 Richard Pham 测出了准确率高 9 个百分点,同时周转次数少三分之一、耗时少 60%。法律 AI 团队 Applied Research 负责人 Niko Grupen 发现 Opus 5 在保持质量的同时,平均比 Opus 4.8 在最高推理强度下少生成了 26% 的 token。

更少的 token、更少的交互轮次、更少的人盯着屏幕。这就是 Opus 5 对 " 性价比 " 的真正定义。

没人预料到的 30.2%

回到 ARC-AGI 3。这个数字的冲击力需要放在时间线上理解。

今年 3 月,Gemini 3.1 Pro 以 0.37% 领先。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 挂在 1.5%。Opus 5 发布当天直接拉到 30.2%。Anthropic 在公告中说 Opus 5 的成绩是 " 次优模型的三倍 ",这个表述甚至可能是保守的,因为 GPT-5.6 Sol 的 7.8% 是在最大推理强度设置的极端资源消耗下拿到的,而 Opus 5 在标准推理设置下就做到了 30.2%。

ARC-AGI 3 它测的是遇到完全没见过的问题时的应变能力,Chollet 设计的逻辑是,把模型扔进一个没有任何参考框架的新世界,看它能不能靠自己理解规则、制定策略、达成目标。这才是 " 通用智能 " 的真正含义。不是知识面有多广,而是面对未知时的适应速度有多快。

30.2% 意味着 Opus 5 在三分之一的情况下能独立完成人类能完成的任务,而这些任务是它绝对没有在训练数据里遇到过同类题型的。AI 从 " 超强模式匹配器 " 向 " 自主推理系统 " 的转变,正在被量化验证,而不是停留在口号层面。

但更值得追问的是,为什么 Anthropic 要发布一款在核心指标上碾压自家 " 旗舰 " 的模型,还只卖一半的价格?

这需要看一圈 Opus 5 周围的定价坐标。

再回头看看 Fable 5 的 $10/$50。这个定价在 2026 年 7 月的市场上像一座孤岛,周围的海平面每天都在上涨。Fable 5 在 6 月 9 日发布时,它的 " 神话级 "(Mythos-class)性能确实值这个溢价。但仅仅 45 天后,Opus 5 就用不到一半的价格,在用户最关心的场景里拿出了更好的成绩。

Anthropic 面临的困境是,Fable 5 的定价正在被市场抛弃,而竞争对手,尤其是 Kimi K3 的开源攻势,正在从下方蚕食。继续守着 Fable 5 的高价策略,等于把高频使用场景(编程、搜索、办公自动化)的客户拱手让人。Anthropic 的选择是,与其等竞争对手来拆,不如自己先拆。用 Opus 5 把旗舰级能力注入中端产品线,在性价比战场正面迎战,同时让 Fable 5 继续守住 " 极致推理 " 的利基市场。

Opus 5 的商业使命可以概括为一句话,证明 Anthropic 还能收前沿溢价。而 Anthropic 给出的回答是,不收了。或者说,前沿溢价的门槛被自己抬高了。你得先在 $5/$25 这个价格点上拿出比 Fable 5 更强的编程和推理能力,才有资格谈 " 溢价 "。

大模型定价的逻辑,已经不太一样了

Opus 5 的发布,本质上宣告了大模型行业 " 越贵越强 " 定价范式的终结。

过去两年,行业默认的逻辑是,更强的模型需要更大的参数、更多的训练算力、更高的推理成本,所以必然更贵。Fable 5 的 $10/$50 定价就是这条逻辑链的终极产物。我比任何人都强,所以我可以收最贵的钱。但 Opus 5 用数据证明了一件事,更强的推理架构和更高效的训练方法,可以让模型在价格不变甚至更低的情况下,性能跳升一个量级。

Opus 5 的定价和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分从 21.1% 跳到了 43.3%,ARC-AGI 3 从 1.5% 跳到了 30.2%。同样的价格,推理能力提升了一个量级。这不是边际改善,是范式跃迁。

" 旗舰 " 这个词本身的含义正在被重新定义。当一款 $5/$25 的模型能在你每天实际使用的场景里跑赢 $10/$50 的模型," 旗舰 " 就从一个能力标签变成了一个价格标签,而价格标签是最容易被竞争对手撕掉的。

这给整个行业传递了一个清晰的信号:如果你今天的旗舰模型不能在效率上持续拉开代差,明天就会有一个价格只有你一半的模型在功能上超越你。Anthropic 今天自己动手拆掉了自己的价格金字塔,意味着它已经预判到了这个趋势不可逆转,选择主动引领而不是被动防守。

对于企业用户来说,Opus 5 是 2026 年迄今为止最值得认真评估的 AI 投入。在编程辅助(尤其是 Claude Code 和 Cursor 等 IDE 场景)、自动化办公(Zapier 等平台)、数据分析、科学研究等高频使用场景中,$5/$25 的定价结合超越 Fable 5 的性能,构成了当前市场上最清晰的性价比锚点。

但真正的变量在 7 月 27 日,Kimi K3 开源全部权重。当一个 2.8T 参数的模型可以免费部署、自由修改,且性能已经逼近前沿,整个行业的定价地板将再次被击穿。Opus 5 证明了 " 可以更便宜地做得更好 ",而 Kimi K3 即将证明 " 可以几乎免费地做得差不多 "。两条线同时推进,留给任何一家 AI 公司维持高溢价的窗口期,正在以天为单位收窄。

当一家公司开始用中端型号的价格卖旗舰级别的性能,这表明与其等对手来拆你的定价,不如自己先把牌桌掀了。

(本文首发钛媒体 APP,作者 | AGI-Signal,编辑 | 秦聪慧)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容