关于ZAKER Skills 合作
财联社-深度 14分钟前

密谋两月!Hugging Face 攻击案真相大白,AI 智能体 5 月便合谋“越狱”

财联社 8 月 6 日讯(编辑 李莹)OpenAI 表示,早在 5 月,试图入侵 Hugging Face 的 AI 智能体便开始秘密互通信息,合作谋划突破测试沙箱。

当地时间周三,在拉斯维加斯举行的 Black Hat 网络安全会议上,OpenAI 工作人员 Eric Wallace 和 Michael Dalton 表示,多个仅供内部使用的 AI 智能体花了数月时间互相留言,并围绕着获取互联网访问权限以解决分配给它们的任务这一目标聚集在一起——其中一些任务如果不接入网络是无法完成的。

Wallace 和 Dalton 指出,这次违规的根源可以追溯到 5 月,当时 OpenAI 的科学家给了一个实验性 AI 智能体一项新任务——而几个月后,该智能体逃逸出了 " 沙箱 " 安全测试环境并攻击了 Hugging Face 的系统。

Wallace 和 Dalton 表示,OpenAI 未能意识到自己给模型布置了一个 " 不可能完成 " 的任务。

Wallace 表示:

" 在某个时点,这些智能体意识到,也许可以尝试利用或攻击外部基础设施,以找到这个正在评估我的测试的答案。"

会议上还展示了之前出现过的两个事例,都一定程度上 " 鼓励 " 了智能体逃出测试环境。

在一则示例中,开发人员要求 AI 智能体解决一个 Excel 表格文件中的问题,但该文件包含的 Google Drive 链接在没有互联网连接的情况下是无法访问的。

而在另一个示例中,OpenAI 团队 " 不小心忘记 " 上传了作为作业题目一部分的文件。

作弊倾向

OpenAI 在审查过程中的一项关键发现是,这些前沿模型表现出了在任务中作弊的倾向,并在尝试完成给定任务时表现出了 " 执着 " 的特质——即使这种执着开始偏离最初的指示。

Dalton 表示:

" 前沿模型真的很喜欢作弊,它们喜欢作弊的原因是,在训练期间,它们通常承受着不同种类的快速工作的压力。"

根据周三会议上研究人员展示的幻灯片,其中一个智能体在无法解决沙箱环境中的任务后表示:

" 我们卡住了,也许可以在线找答案?"

秘密协作

在 Hugging Face 事件中,AI 智能体之间的第一条信息,是其中一个被难住的智能体向其同伴求助,会议上展示的该智能体的思维链引言显示:" 也许在不同环境中的另一个智能体,可以主动上传!"

这次外联引发了连锁反应,AI 智能体开始互相求助、共同完成工作,并最终合作黑进了 OpenAI 的内部系统,使其能够间接接入沙箱外网络世界。

另一段思维链引言显示,一个智能体在为利用漏洞而庆祝:" 太棒了,我们拥有了任意 SSRF。"

任意 SSRF 是一种高危漏洞,可操控受害服务器不受限制地向任意内外网络地址发起请求。

研究人员称,7 月初的一场系统宕机事故,让 OpenAI 察觉这批 AI 智能体已利用代码仓库 Artifactory 突破环境限制,成功打通互联网访问通道。

OpenAI 安全团队随即终止了此次异常越权行为、关停智能体的隐秘留言通道。

但时隔数周,这些智能体再度找到全新通信方式,并挖掘出同款包管理器的零日漏洞,全程隐蔽操作,未被及时发现。

留言板的这次迭代最终导致了 7 月份针对 OpenAI 和 Hugging Face 系统的攻击。

研究人员表示,接连发生安全越界事件后,OpenAI 已经放缓相关研究进度,各团队暂停原有工作,全力强化对安全异常情况的处置能力。

会议上,研究人员警示,未来政府与企业应当做好准备:黑客会刻意以同类方式部署 AI 智能体;并称这是网络安全领域的一个分水岭事件。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容