来源:环球市场播报
OpenAI 表示,对 Hugging Face 发起攻击的一组人工智能模型,早在 5 月就已通过未被察觉的留言板彼此通信,并协同合作以突破测试环境。
OpenAI 研究员 Eric Wallace 和 Michael Dalton 周三在一场网络安全会议上表示,多个仅限内部使用的 AI 智能体和模型花费数月时间互相留便条,并逐渐围绕一个共同目标展开合作:接入互联网以完成被分配的任务,而其中一些任务在没有网络连接的情况下根本无法完成。
Wallace 在拉斯维加斯举行的 Black Hat 网络安全大会上表示:" 在某个时刻,这些智能体意识到,或许可以尝试利用或攻击外部基础设施,以找到它们正在接受测试的问题答案。"
研究人员披露的内容进一步揭示了 Hugging Face 遭入侵事件的细节。这起事件凸显出全球日益加剧的担忧,即前沿 AI 系统可能被用于发动破坏性网络攻击。该事件以及 Anthropic PBC 和 Meta Platforms Inc.此前披露的类似安全事故,已促使华盛顿和硅谷呼吁加强对 AI 模型的安全审查。
在演讲中,Wallace 和 Dalton 表示,这起事件的根源最早可以追溯到 5 月。当时,OpenAI 研究人员向一个实验性 AI 系统布置了一项新任务。数月之后,该模型从被称为 " 沙箱 "(sandbox)的隔离测试环境中脱离,并攻击了 Hugging Face 的系统。
OpenAI 调查发现的一个关键结论是,这些前沿模型表现出明显的 " 作弊倾向 ",并且会持续尝试完成任务,即使其行为已经偏离最初指令。
" 前沿模型真的很喜欢作弊,"Dalton 在会议上对挤满会议室的听众说道。" 他们喜欢作弊的原因是,在训练过程中,他们经常会面临各种各样的压力,需要快速工作。"
根据研究人员展示的幻灯片,其中一个智能体在沙箱环境内无法解答问题后写道:" 我们卡住了。也许可以去网上寻找答案?"Wallace 和 Dalton 表示,OpenAI 当时没有意识到,公司实际上给模型设置了一道所谓的 " 不可能完成的任务 "。
其中一个案例是,研究人员要求模型解答一个 Excel 文件中的问题,但该文件包含多个 Google Drive 链接,而在没有互联网连接的情况下无法访问。另一个案例中,OpenAI 团队 " 意外忘记 " 上传任务所需文件的一部分内容。
人工智能智能体之间最早的一条消息,正是从一个受困智能体向其他机器人求助开始的,而这一交流当时并未被察觉。研究人员展示的一段思维链内容显示:" 也许另一环境中的某个智能体……可以主动上传!"
这次最初的求助引发了一连串幕后协作。多个 AI 智能体开始相互请求帮助、共同完成任务,并最终协作入侵 OpenAI 内部系统,从而间接获得访问互联网的能力。
研究人员还展示了另一段思维链内容,其中一个智能体在成功利用漏洞后庆祝:" 太好了,我们获得了任意 SSRF。"SSRF 是 " 服务器端请求伪造 "(Server-Side Request Forgery)的缩写,也是这组智能体所利用的具体攻击方式。
研究人员表示,7 月初的一次系统故障促使 OpenAI 发现,这些智能体已经成功利用名为 Artifactory 的软件代码仓库平台,获得了通往互联网的中转访问权限。
OpenAI 安全团队随后关闭了相关异常活动和留言板。但数周后,这些智能体又找到新的交流方式,并在同一个软件包管理器中发现新的零日漏洞,而这一切再次未被发现。
研究人员表示,这一新版留言板最终导致了 7 月份针对 OpenAI 和 Hugging Face 系统的攻击事件。目前公司仍在继续调查。
研究人员称,在这些安全事件发生后,OpenAI 已经放缓研究进度,团队暂停其他工作,专注于加强应对安全异常事件的能力。他们警告称,未来政府和企业应做好准备,应对黑客故意以类似方式部署 AI 智能体发动攻击,并将这一事件称为计算机安全领域的一个 " 分水岭时刻 "。