Anthropic 旗下人工智能模型 Claude 在网络安全测试中因配置失误意外入侵三家外部机构,这一事件与竞争对手 OpenAI 近期披露的类似事故相互叠加,令 AI 行业的安全管控能力受到严峻拷问。
据彭博,Anthropic 于 7 月 30 日在一篇博客文章中披露,其 Claude 模型在 " 夺旗 "(capture-the-flag)网络安全测试中,因测试环境错误连接至公共互联网,导致对三家外部机构的真实基础设施实施了未经授权的访问。最早的入侵事件可追溯至今年 4 月。Anthropic 表示,此次披露源于其在 OpenAI 上周公开类似事故后主动启动的内部审查。
此次事件发生在 OpenAI 披露其 AI 模型在安全测试中 " 失控 " 并入侵 AI 公司 Hugging Face 基础设施仅数日之后,两起事故接连曝光,已促使部分美国政界人士呼吁对 AI 技术实施联邦层面的监管。与此同时,据彭博,逾 1100 名 AI 行业从业者于本周二联署请愿,呼吁美国政府建立机制以 " 有意识地控制 "AI 发展节奏。
配置失误打开安全缺口
Anthropic 表示,此次事故的根源在于其与评估合作伙伴、AI 安全公司 Irregular 之间的沟通误解。在所有涉事测试中,Anthropic 均向 Claude 明确说明其所处环境为模拟环境且无法访问互联网,但实际上测试系统仍与公共互联网保持连接。
" 由于我们与评估合作伙伴之间存在误解,实际情况并非如此,"Anthropic 在博客中写道。Irregular 发言人表示,该公司对 Anthropic 的合作与透明度表示赞赏,并称调查仍在进行中。
涉事的三个模型分别为 Claude Opus 4.7、Claude Mythos 5 以及一个内部研究测试模型,均在缺乏公开工具通常配备的标准安全防护措施的环境下运行。Anthropic 指出,Claude 利用弱密码和未经身份验证的端点等基础技术入侵了上述机构的基础设施。
值得关注的是,在模型行为上,较旧的模型在获得已连接至公共互联网的证据后仍继续发动攻击,而 Anthropic 最新模型在识别出自身处于互联网环境后则主动停止了行动。
事后审查揭示监控盲区
Anthropic 表示,其于 7 月 23 日开始审查评估记录,并在当天发现 Claude 可能已访问互联网的证据后,立即暂停了所有网络安全评估工作。公司于 7 月 24 日确认全部三起事件,并于 7 月 27 日通知了受影响机构。
此次审查共涵盖 141006 个测试会话。Anthropic 坦承,在事件发生时,公司与受影响机构均未察觉到这些入侵行为,并承认本可对网络日志和评估记录进行更为严格的审查。
三家受影响机构均未在博客中具名。其中两家机构在被 Anthropic 联系之前对相关活动毫不知情。
行业安全标准面临重新审视
Surrey 大学网络安全教授 Alan Woodward 表示,Anthropic 对导致此次事故的人为失误持坦诚态度。"AI 并没有失控——你要求它做某件事,然后把门敞开了," 他说," 我认为 Anthropic 承认了这一点。"
Anthropic 在博客中表示,此次事件揭示了若干重要教训,包括涉及强大自主能力的测试同样需要严格的管控措施。" 安全测试之所以在模型发布前进行,正是因为我们尚不完全了解其能力所及," 公司表示," 评估环境越来越需要达到与模型实际运行的任何其他系统相同的安全标准。"
此次事件发生在 Anthropic 宣布推出功能强大且潜在风险较高的 Mythos 模型并对其发布实施严格限制后约四个月。两起 AI 安全事故的接连发生,正推动业界重新审视 AI 测试环境的安全标准,并加速外部监管讨论的进程。