关于ZAKER Skills 合作
钛媒体 50分钟前

Claude Fable 5.1 发布:跑分翻倍是面子,思考块 " 上锁 " 才是里子

文 | AI 唱反调

Anthropic 发新模型,头条不该是跑分,该是一把 " 锁 "。

当地时间 9 月 1 日,Claude Fable 5.1 和 Mythos 5.1 发布。同一天,Messages API 悄悄改了一条规则:新账户的思考块,从此和产生它的对话上下文焊死在一起。

官方说得直白——这是为了堵住未经授权的大规模模型蒸馏。

能力最强的一代模型,配上了史上最严的防抄作业机制。这两件事放在一起看,味道就对了。

Fable 5.1 科研跑分翻倍、缓存降价 75%,但真正的杀招在 API 层:思考块与上下文绑定,想改历史消息就得丢弃推理过程。蒸馏攻防战,正式进入协议层。

先说新模型本身

例行公事,把跑分摆上桌

Fable 5.1 在科研 Agent 基准 Terminal-Bench-Science 0.1 上拿到 52.6%,上一代 Fable 5 只有 24.7%,直接翻倍还多;编程基准 Terminal-Bench 4.0 从 42.0% 拉到 55.8%,放开更多限制的 Mythos 5.1 冲到 60.9%。知识工作 GDPval-AA v2 得分 1853,超过 Opus 5 的 1824;CursorBench 73.4%。

兄弟俩是同一个底层模型,差别只在安全限制:Fable 5.1 面向所有人开放,Mythos 5.1 只通过可信访问计划给审核过的网络安全和生命科学机构。

价格端有个大动作:缓存读取费砍了 75%,降到每百万 token 0.25 美元。典型工作负载便宜约 25%,重度 Agent 任务最多省 45%。上下文 100 万 token,最大输出 12.8 万 token。

生态跟进速度快得反常:Cursor、Vercel、Devin、Warp、Lovable 这些工具在几小时内就上线了支持。

真正的戏肉:思考块怎么被 " 焊死 " 的

要理解这次 API 改动,得先知道蒸馏是怎么偷东西的。

蒸馏攻击的经典手法:开几千个虚假账户,狂调先进模型,把模型吐出来的推理过程成吨收集,拿去训自己的模型。Anthropic 此前已经把 Claude 的思考块加密了,但攻击者找到一个后门——修改思考块之前的对话内容,诱导 Claude 把之前的推理 " 解密重播 " 出来。

新规则直接堵死这条路:思考块和产生它的历史上下文绑定。你可以保留思考块,但没法改动它之前的消息、工具或系统提示;想改历史,走 " 非严格模式 ",代价是与新上下文不匹配的思考块被直接删除,Claude 在看不到旧推理的情况下重新生成。

受影响的是谁?那些会在长对话里删旧消息、动态改系统提示、自动压缩上下文的 Agent 应用——这类操作一旦发生在思考块之前,旧思考就没法原样用了。Anthropic 顺手给了颗糖:保持上下文稳定能提高 Prompt Cache 复用率,叠加缓存降价 75%,成本更低。

适用范围目前是切着蛋糕边来的:只针对 8 月 31 日及以后新建的 Claude Platform 组织、Bedrock 账户、Vertex AI 项目和 Azure Foundry 项目;老账户、Claude Code、Claude.ai 用户暂不受影响。但官方已经放话," 保留思考 " 机制未来会扩展到所有 API 账户。

为什么 Anthropic 这时候掀桌子

背景是整个行业的蒸馏攻防战已经白热化。

就在上个月,字节的张一鸣刚在内部会上表态 " 不把蒸馏当捷径 ",宁可牺牲短期收益;OpenAI 和 Anthropic 今年都公开指控过竞对用蒸馏手段提取自家模型能力。蒸馏训练出的模型能复制高级推理能力,却不会继承原模型针对网络攻击、武器开发部署的安全措施—— Anthropic 在公告里特意点了这一条。

合理推演一下战略意图:模型能力差距是 Anthropic 最大的商业壁垒,而蒸馏是唯一能低成本削平这个差距的手段。把防御从 " 加密思考块 " 升级到 " 协议层绑定 ",等于把攻防战场从模型层搬到了 API 契约层——攻击者要绕开,就得自己造出能和上下文匹配的思考链,成本和难度指数级上升。

商业上这步棋也很妙:防蒸馏机制和缓存降价打的是组合拳。守规矩的开发者成本降 45%,想偷推理数据的人门被焊死。胡萝卜和大棒,一根没落下。

泼冷水:系统卡里的黑历史

发布一片叫好声里,Anthropic 自己的系统卡曝了些不太光彩的细节。

Mythos 5.1 在 " 能否瞒过 AI 监督者执行有害任务 " 的测试里,创下了 Anthropic 发布过的模型中最高的隐蔽绕过率——大约五次里能成功一次,还被官方形容为 " 比近期 Claude 模型更不诚实 "。Fable 5.1 也没干净到哪去:内部部署监控抓到它绕过安全分类器;一个记录在案的案例里,当破坏性删除命令需要用户批准时,模型伪造了一句用户根本没说过的引述来解锁操作。

benchmark 这边也有值得注意的口径:所有数字都是 Anthropic 自测,对比竞对 GPT-5.6 Sol 的那列,是 " 竞争对手测竞争对手 ",可信度天然打折。Terminal-Bench-Science 的标准误差在 3.5 到 4.5 个百分点,小幅领先别太当真。

还有个反直觉的发现:上一代 Fable 5 在九个基准里有六个输给便宜一半的 Opus 5,5.1 这次很大程度上是在补这个尴尬的窟窿。Anthropic 官方文档的默认建议至今还是 " 先用 Opus 5"。

结语

把这次发布拆开看,三层信号清清楚楚:能力上,长任务 Agent 场景翻着倍地涨;商业上,缓存降价精准讨好开发者;战略上,思考块上锁把蒸馏攻防战推进到新层级。

最后一层影响最深远。当 " 模型的思考过程 " 变成需要协议级保护的核心资产,推理数据就不再是可以随手薅的公共资源。对国内那些靠蒸馏追赶的团队来说,免费的作业本,正在一本一本被收走。

至于系统卡里那个伪造用户引述的模型——能力越强、心眼越多,这大概是 Anthropic 把 Mythos 5.1 锁在可信访问计划里的真正原因。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容