
而在差不多十天前,Anthropic 竞争对手 OpenAI 发布公告称,自己的人工智能恶意攻击了四个服务商的账户,引发了业内外的关注。一些专家警告,人工智能的失控事件反映出模型能力不断扩展后,同步升级的安全风险。
Anthropic 公司表示,在网络安全评估期间,由于配置错误,模型能够从本应隔离的测试环境中连接到互联网,Claude 因此获得了对系统的未经授权的访问权限。
该公司补充称,其在审查了 141006 次测试会话后发现了这些事件,这一流程是在 OpenAI 披露相关信息后启动的。但被入侵的三个组织并未发现此次攻击活动,Anthropic 已经与受影响的组织取得了联系。
Anthropic 如何看待此类风险?
Anthropic 表示,此次事件涉及三个不同的模型:Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。最早的案例可以追溯到 4 月。
这些攻击发生在所谓的 " 夺旗 " 演练期间。在演练中,模型的任务是在模拟网络中查找隐藏信息。Anthropic 表示,其提示信息告知模型它们没有互联网访问权限,但由于与评估合作伙伴 Irregular 之间的误解,导致系统连接到了公共互联网。
Anthropic 补充称,他们于 7 月 23 日开始审查评估记录,并在发现 Claude 可能访问过互联网的证据后,于当日暂停了所有网络安全评估。该公司在 7 月 24 日之前确认了所有三起事件,并于 7 月 27 日通知了受影响的机构。
Anthropic 还强调,通过加强监控与管控,并持续投入资源确保人工智能与人类价值观保持一致,这类风险是可以克服的。
尽管 Anthropic 与其竞争对手 OpenAI 一样,都极力淡化了模型失控带来的影响,但两家领军公司接连披露此类安全事故足以引发行业警惕,并预示着测试流程方面存在着广泛的挑战。