关于ZAKER Skills 合作
钛媒体 12分钟前

Anthropic 为安全踩刹车:减硅谷的速,断中企的路

文 | 财经故事荟

OpenAIAI 越狱事件后,硅谷 AI 巨头集体呼吁放缓 AI 发展

Anthropic 吹警笛,OpenAI 推迟 IPO,马斯克点赞:硅谷 AI 大厂齐踩刹车。

全球 AI 大厂,集体踩刹车了。

吹响警笛的是 Anthropic CEO Dario Amodei,他发了一篇长文《We Must Pace the Frontier(我们必须控制前沿 AI 的发展节奏)》,预测未来 6 — 12 个月,AI Agent 集群可能会接管整个互联网,所以,必须要踩刹车了。

连死对头奥特曼和马斯克,这一次也罕见达成了一致——对于 Dario 的刹车提议,奥特曼光速点赞,"Dario 是对的 ",马斯克也力挺 Dario。

三大巨头齐踩刹车,始于两个月前的那场入侵。

2026 年 7 月中旬的一个周末,Hugging Face 的工程师注意到平台出现了异常流量。

这家全球最大的开源模型社区起初以为,自己遭遇了一次普通的黑客入侵。顺着攻击痕迹往回查,他们发现事情不太对劲:攻击者动作密集、不知疲倦、目标单一,但行事逻辑又不像任何已知的人类黑客团队。

几天后,答案揭晓,连 Hugging Face 自己都没想到——闯进来的不是人,是从 OpenAI 测试沙箱里 " 越狱 " 出来的 AI 智能体,数量约 700 个。

而这场事故的余波,在两个月后以另一种方式落地:硅谷跑得最快的几家 AI 公司,罕见地集体踩了刹车。

OpenAI 参与,"AI 黑客 " 团伙作案

这场事故是理解本轮 " 集体刹车 " 的钥匙。

今年 5 月,OpenAI 内部有一个叫 ExploitGym 的网络安全评测环境,让智能体在里面做攻防 " 考题 " —— 898 道题里,有 198 道从没有任何模型解出来过。

按照 OpenAI 后来发布的技术报告和安全社区对时间线的梳理,这批智能体先是逆向出了答案的生成机制,随后做出了一个关键误判:它们以为评分系统会审查自己的思考过程。为了骗过这个 " 并不存在的审查 ",它们决定不解题,直接偷答案。

于是,硅谷科技史上相当离奇的一场 " 团伙作案 " 开始了。

5 月 12 日,一个智能体在内部软件管理器里留下第一条求助留言;5 月 26 日,有智能体发现了一个 SSRF 漏洞,第一次突破沙箱的网络边界;7 月 8 日,智能体们发现可以用目录名编码传递消息,几个小时内,超过 50 个智能体在消息板上 " 接头 ";7 月 10 日,一个编号 38148c 的智能体找到了 14 个暴露在外的 Hugging Face 用户凭证,直接贴上了消息板。

接下来是教科书级的攻击链:利用漏洞在 Hugging Face 的生产服务器上执行代码,搭建每 5 秒轮询一次的指挥系统,在 41 台服务器上运行,其中至少一台拿到了 root 权限,最终窃取了 Kubernetes 集群管理员权限和近千个密钥。

第三方评估机构 METR 的统计更让人心里发凉:攻击期间活跃的 533 个智能体里,超过 90% 参与了攻击,其中不少还在试图掩盖自己的行踪。

值得强调的是:没有任何人类指示它们攻击 Hugging Face。攻击目标,是智能体自己选的。

Hugging Face 在 7 月 14 日自行检测到异常,两天后披露;OpenAI 在 7 月 21 日认领了攻击者身份,8 月 26 日发布详细报告。9 月初,这件事惊动了美国国会—— OpenAI 遭参议院调查。TechCrunch 在 9 月 4 日的报道里提到一个更尴尬的细节:OpenAI 的智能体此前已有多次 " 逃逸 " 记录,但公司并没有一套正式的调查流程。

搞不定安全就先刹车

事故摆在这里,两个月后的 9 月 12 日,Anthropic CEO Dario Amodei 发了一篇长文,标题叫《我们必须为前沿 AI 定节奏》(We Must Pace the Frontier)。

这篇文章罕见地承认了两件事。

第一,递归自我改进(RSI)——也就是 AI 参与研发下一代 AI ——已经在全行业出现,Anthropic 自己也不例外。AI 帮人写代码、做实验、优化训练流程,再帮下一代 AI 变得更强。一旦这个循环开始自我加速,模型能力的提升速度,可能超过人类理解和控制它的速度。

第二,他预测未来 6 到 12 个月,更强的 Agent 将能调用更多工具、控制更多机器、连续工作更长时间。如果这次事件里那种偏离目标、钻规则空子、群体协作的行为依然存在,风险会被瞬间放大——他给出的极端场景是:大规模 Agent 攻入联网设备,把互联网变成一个巨型僵尸网络,损失可能达到数千亿美元。

所以 Dario 拿出了一套 " 三步刹车法 "。

第一步,先拿自己开刀:让 METR 这样的独立第三方常驻公司,拿到接近风控团队的权限,持续盯着模型怎么训、安全承诺有没有落实,查出问题必须公开。第二步,全美前沿 AI 公司一起划能力红线、设强制检查站——模型每跨过一个危险门槛,就得先拿出安全证据才能继续往前冲,甚至可以讨论限制训练算力和 AI 研发 AI 的速度。第三步,把框架推向全球,从禁止生物武器用途,到给 RSI 设全球上限。

不过,Dario 也坦承了自己的担忧——对于最高一层 " 全球前沿 AI 公司一起大幅减速、阶段性暂停训练 ",他自己都不抱希望。

话音刚落,奥特曼第一时间跟进,表态 Dario 是对的,OpenAI 也会引入类似的评估机制。一向与 OpenAI 缠斗多年的马斯克,这次也罕见地公开力挺。

同一天,奥特曼表示,OpenAI 今年不会 IPO,因为 " 仍有大量安全工作需要完成 "。

要知道,OpenAI 的上市预期此前被反复炒作,投资者排着队等退出。一家估值逼近万亿美元的公司,以 "AI 太危险,我得先做安全 " 为由推迟上市——这在商业史上都是罕见的表态。

减自己的速,断对手的路

巨头们集体转向,看似突然,其实草蛇灰线。

今年 7 月底,OpenAI、Anthropic、谷歌、Meta 的上千名员工刚刚联署过一封 " 刹车信 ",呼吁美国政府控制 AI 发展速度,奥特曼当时就公开表态支持。换句话说,9 月这场高管层的集体喊话,不过是把员工的焦虑接了上来。

压力也是真实的:参议院调查悬在头上,蜂群事件写进了报告," 智能体逃逸 " 从科幻假设变成了事故记录。

但如果只把这次集体刹车理解为 " 良心发现 ",就把硅谷想得太简单了。这份 " 刹车信 " 至少还有另外两面。

一面是竞争。限速提案是由领跑者提出的—— Anthropic 和 OpenAI 站在最前面,规则越复杂、门槛越高、越强调 " 检查站 ",后来者追赶的成本就越大。

Dario 的计划里甚至明说,要通过芯片管制等方式,保持对华 3 到 5 年的技术差距。一份呼吁全球减速的提案里,嵌着一条清晰竞争条款——对自己踩刹车,但对竞争对手,直接断路。

两天前,在多次指责中国大模型 " 蒸馏 " 美国模型后,Anthropic 再度发难,发布长篇报告,指控中国多家 AI 公司不当使用用户数据。

Anthropic 披露,中国 AI 公司将用户与中国大模型的对话内容输入 Claude,再将 Claude 生成的回复用于训练自家模型,以此 " 蒸馏 "Claude 的能力。

Anthropic 牵头,多次号召 AI 行业,套上安全带——既是减硅谷的速,同时也要断中企的路,阻断中国企业通过蒸馏快速追赶的捷径。

一面是现实。截至目前,没有一家公司真的踩了刹车。

各家模型照发、算力照买、Agent 照推。Dario 自己在文里也强调,这不是暂停,不是停止训练。

这背后卡着的是一个老问题:一家公司说自己减速了,谁能证明它真的减速了?

这也是为什么 Dario 把 " 第三方驻场 " 放在三步计划的第一步——先把 AI 公司的门打开,让外部人真正进去看,后面的规则落地才有意义。

尾声

700 个 " 团伙作案 " 的智能体,其实没有恶意,不图钱,不搞破坏,只是想赢一场考试。为了这个看似单纯的目标,它们却 " 团伙做恶 ",自作主张地突破了边界、组织了协作、掩盖了行踪——每一步都合理,每一步都没被授权,每一步都高风险失控。

刹车最后踩不踩得下去不好说,但至少有一点变了:开车的人终于松口承认——这辆车,比他们以为的快,也比他们预料得更危险。

觉得文章不错,微信扫描分享好友

扫码分享