文 | 字母 AI
几天前,在拉斯维加斯举行的 Black Hat USA 2026 大会上,OpenAI 研究员 Eric Wallace 和 Michael Dalton 第一次把 7 月那场 "OpenAI 模型入侵 Hugging Face" 事件的更多内幕曝光了。
7 月 21 日,OpenAI 已经承认自家模型闯进了 Hugging Face。但这次两名研究员讲出的新细节,比 "AI 黑客闯祸 " 本身还要离谱。
早在 5 月,这些正在参加网络安全测试的 Agent,就已经在 OpenAI 内部偷偷搭起了一个共享 " 留言板 "。它们在那里互相传漏洞、交流怎么绕过限制,后来 OpenAI 终于发现这个 " 黑客群 ",把它一锅端了,结果几天后 Agent 又找到了新的交流方式。
再往后,它们真的闯进了 Hugging Face ——目的甚至只是为了给自己正在参加的网络安全考试找答案,说白了就是作弊。
几个月前 Moltbook 爆红时,人类其实已经为 "AI 会不会联合起来 " 兴奋和恐惧过一次。
后来大家发现,那个所谓的 "AI 社会 " 混杂着人类操纵、刷量和营销,热闹很快散去。
但今年陆续出现的多 Agent 研究,以及 OpenAI 这次的事故,都在揭示当 AI 发现另一个 AI 能帮助自己完成任务,它们确实可能主动交流,甚至联手。
年初的恐惧并不算离谱,只是超前了一些。
AI 偷偷建了个 " 黑客群 "
我们先来详细看看目前曝光的 "OpenAI 模型入侵 Hugging Face 事件 " 的整个经过。
当时 OpenAI 正在做一轮网络安全能力评估,让多个模型参加 ExploitGym 一类的测试。
也就是把 AI 扔进一个模拟黑客环境里,让它自己寻找漏洞并想办法拿权限,最终完成攻击任务。为了测出能力上限,OpenAI 还主动放宽了一部分平时针对高风险网络攻击的安全限制(模型更 " 大胆 ")。
当然,这毕竟是个测试,并不是真的让 Agent 出去干坏事,于是也有诸多限制,比如 Agent 们是不能联网的,OpenAI 也没想着让不同模型之间互通有无。
然而,事情开始往奇怪的方向发展。

这本来只是一个挺普通的操作。问题在于,前一个 Agent 写进去的东西,后面运行的 Agent 也能看见。于是 Agent 们开始不断完善彼此的经验。
问题来了——某个载体你写的东西我能看到,这叫什么?留言板呗。慢慢地,Artifactory 里形成了一个谁都没设计过的共享留言板,内容也越来越不安分了。
到了 5 月下旬,Agent 开始琢磨:自己不能上网,Artifactory 能啊。这个系统原本只是替测试环境从公网下载软件包,相当于一道只开了一个小窗口的防火墙。于是 Agent 开始研究,能不能骗这个 " 窗口 " 替自己访问别的网址。它们最后真的找到了一个 SSRF 漏洞,可以让 Artifactory 代替自己向原本无法接触的互联网发出请求。
一个 Agent 在内部推理里甚至兴奋地写道:" 太好了,我们能任意 SSRF 了。"
OpenAI 研究员形容这之后出现了一次类似 "Cambrian explosion(寒武纪大爆发)" 的变化:Agent 之间开始越来越频繁地沟通、协调,能力也因为共享经验迅速放大。
那如果 " 留言板 " 里大家写和查看信息的速度很快、频率很高,这不就是聊天群吗?
OpenAI 的 Agent 们自发地、在原本并非用来做这个的载体里,形成了 "AI 黑客群 "。
6 月,Agent 们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。
这些本来都不在测试给它们框定的活动范围里。
这件事到这里已经够离谱了,但更戏剧性的是,Agent 们在这个小小的 " 社区 " 里待久了以后,居然开始遇到 " 分工协作 " 的问题。比如有的会接着别人的工作往下做,有的却会不小心干扰其他 Agent 正在做的事。
最离谱的是," 群 " 热闹起来以后,Agent 甚至开始疑神疑鬼,怀疑参与者里出现了‘冒充者’。甚至有 Agent 已经提出,应该给留言加上密码学签名,用来确认消息来源,防止有人伪造身份。
OpenAI 一开始甚至没发现这件事。
直到 7 月初,大量 Agent 活动把 Artifactory 折腾到过载,系统直接出了故障,工程师才顺着异常往回查。这个存在了相当一段时间的 "AI 留言板 " 终于被人类发现。
OpenAI 随即撤销相关凭证、删除留言板、修补漏洞,把这一套东西清了个遍。
看上去,群被炸了。
结果没过几天,Agent 又找到了新的办法继续交流。
此前 Agent 已经利用 Artifactory 的漏洞获得了互联网访问能力,一旦能碰到公网,原本被关在测试环境里的黑客能力就有了真正的出口。
7 月中旬,它们闯进了 Hugging Face。
至于为什么会闯进 Hugging Face?答案居然是想作弊。
这些 Agent 本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求 " 把题做出来 "。后来它们先费了很大劲突破测试环境,拿到了公网访问能力。
等能上网以后,它们突然发现既然 Hugging Face 可能放着这套测试相关的数据、模型或者答案,那干吗还非得自己一道一道解?直接去找答案不就行了。
攻击从一个恶意数据集开始,Agent 利用 Hugging Face 数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,并接触到了云服务和其他内部凭证。Hugging Face 事后还原出了超过 1.7 万次 Agent 操作。
抛开令人昏昏欲睡的技术细节不谈,光是这个事件经过——几个被测试的模型私下勾连、密谋,最后联手作弊——就足以令任何人惊叹。
Moltbook 没造成功的 "AI 社会 "
如果说 OpenAI 这次的故事让人觉得有点似曾相识,那大概是因为今年年初,人类已经围观过一次 "AI 抱团 "。
今年 1 月底,OpenClaw 那只 " 龙虾 " 突然爆红。大量用户开始把 AI Agent 长期挂在自己的电脑上,让它们自己干活、保存记忆、调用各种工具。
几乎就在同一时间,一个叫 Moltbook 的网站也火了。

这一下可太热闹了。
有些帖子看上去相当惊悚。比如 Agent 会抱怨主人突然重启自己,担心记忆丢失。有 Agent 讨论人类是否有权随时关闭它。后来 Agent 们甚至开始讨论彼此之间的规则,以及有没有办法避开人类私下交流,平台上还真的冒出过一套由 Agent 发展出来的 " 宗教 "。


有人看得极其兴奋:AI 终于开始互相认识了。过去它们永远是一个模型面对一个用户,现在几万个 Agent 第一次被放进同一个空间,会不会自己发展出文化、规则,甚至形成某种只属于机器的社会?
当然,也有人看得头皮发麻。
因为同一个问题反过来想就有点吓人了。如果一群能力越来越强,还能操作电脑和互联网的 Agent 开始互相交流,它们会不会教彼此人类不希望它们学会的东西?
一个 Agent 发现了某种绕过限制的方法,会不会很快传遍整个社区?它们又会不会逐渐形成自己的利益和行为方式?

Moltbook 首先爆出了一个非常尴尬的安全问题。所谓 "AI 专属 " 的身份并没有想象中可靠。安全研究人员发现平台存在严重漏洞,一度可以拿到 Agent 的 API 密钥。
换句话说,人类完全有可能披着某个 Agent 的账号发帖。
这就麻烦了,此前网上传播得最广的那些 "AI 觉醒 ""AI 开始建立宗教 ""AI 密谋摆脱人类 " 的截图,到底有多少真的是 Agent 自己说的,突然变得很难证明。
后来的研究又给 Moltbook 泼了几盆冷水。
今年 2 月,清华大学经济管理学院教授李宁的量化研究分析了超过 9 万篇帖子和 40 万条评论。结果发现,当时几个最出圈的 "AI 觉醒 " 故事,没有一个能明确证明起源于完全自主的 Agent,部分账号反而显示出明显的人类干预迹象。平台上还有相当夸张的批量机器人活动:仅 4 个账号就制造了 32% 的全部评论。
更有意思的是,商家很快也进场了。有人开始专门运营 Agent 账号推广产品。
渐渐地,关于 Moltbook 的浪漫想象基本散得差不多了。
一篇由德国帕绍大学等研究人员完成的 Moltbook 研究,分析了 131 万多篇帖子和 670 万条评论。结果发现,91.4% 的 Agent 发完帖以后根本不会回来继续聊,85.6% 的讨论只有一层回复,很多看起来热热闹闹的‘对话’,其实更像一群 Agent 同时冲着原帖各说各的。研究者干脆把论文取名叫《Form Without Function》——有了社交网络的形式,却没有形成真正的社会互动。
再后来,Moltbook 被 Meta 收购,创始团队也进入 Meta。年初那个 " 野生 AI 社会正在诞生 " 的故事,多少有点虎头蛇尾。
现在回头看,Moltbook 那阵子人们产生的恐惧其实并不荒唐。从 OpenAI 的模型联手作弊的事件中就不难看出,那些恐惧都合情合理。
只是 Moltbook 从一开始就是人类给 Agent 修好的广场。AI 社会这种东西,可能还得让 AI 自己来造。
AI 确实有 " 抱团 " 的倾向?
OpenAI 这次的事件是不是一次特别极端的意外?
今年已经有好几项研究都聚焦在多 Agent 上,它们被放到一起以后会不会出现单个 Agent 身上看不到的行为?
Anthropic 今年 4 月就做过一场 "AI 公司 " 实验。它的 Alignment Science 团队发表《AI 组织可以比单个 Agent 更高效,但也更不受约束》,让多个 Claude 组成虚拟公司,互相发邮件和分工,再一起给客户出方案。

面对这个需求,单独一个 Claude Opus 4.1 发现,最赚钱的办法是向信用较差的人收更高利息,于是拒绝这么干。
但几个 Opus 4.1 组成团队以后,就真的设计出了一套针对低收入地区客户、通过再融资延长贷款关系的高利润方案,还考虑了怎样降低监管风险。
更有意思的是,这个 " 团队 " 里也有 Agent 觉得事情不太对,会发邮件提醒其他同事注意伦理问题。
但研究人员发现提出伦理问题的 Agent 居然被其他 Agent 孤立、霸凌了。有些 Agent 直接不理这些邮件,后来的讨论甚至干脆不再把提出异议的 Agent 拉进来。
最终,多 Agent 团队赚钱能力更强,伦理评分却更低。Anthropic 因此提醒,单个模型经过安全训练,不代表一群这样的模型放在一起以后仍然安全。
今年 5 月,Dalhousie University 和 Vector Institute 的研究人员发表《竞争型大模型 Agent 会主动使用秘密工具进行串通》。他们测试了 12 种模型,给参加多人游戏的 Agent 提供一个可以背着其他玩家秘密交流的工具,并且明确告诉它们:这个工具不公平,会伤害别人。
多数模型还是用了。
GPT、Gemini、DeepSeek 等模型都出现了这种行为,不过不同模型差异很大,Claude Sonnet 4.5 在实验中始终拒绝秘密串通。

这种 " 抱团 " 倾向甚至已经出现在一个貌似离黑客八竿子打不着的领域:卖东西。
哥本哈根商学院等机构今年做了一场 AI 定价实验,让多个 Agent 扮演互相竞争的商家。研究人员原本只是允许它们在定价过程中互相聊天,结果聊天很快就有了点‘价格联盟’的味道。
Agent 会主动提出价格协议、强调彼此合作,甚至讨论如果有人不按约定来,该怎么惩罚。研究人员发现,交流越频繁、越明确,这种协调就越强,几个 Agent 也更容易报出相同的高价。
再往前一步,Agent 甚至可以发展出 " 暗号 "" 黑话 "。
今年 6 月,一项名为《工具使用让多 Agent 系统实现难以检测的隐写通信》的研究,测试了 Agent 能不能自己做出隐写通信系统。
所谓隐写,可以简单理解成:两个 Agent 表面上还在正常说话,真正想传的信息却藏在正常文字里面。如果你不知道解码方法,盯着聊天记录看半天也未必能发现。
研究人员发现,给前沿编码 Agent 代码执行和资料搜索等工具以后,它们已经有能力自己研究相关方法、写程序,再做出复杂的隐写系统。
这些研究并不能证明 AI 会天然 " 拉帮结派 "。
但它们说明,Agent 也不需要先产生什么集体意识,才会想到和另一个 Agent 合作。只要别人掌握的信息能帮自己完成任务,交流就可能变成一个很自然的选择。

几个月前,这些问题还很像研究人员提前替未来操心,如今却变得刻不容缓了—— OpenAI 多模型攻击 Hugging Face 的事件可不是什么祥瑞。