文 | 字母 AI
先是 Anthropic,再是 OpenAI,现在连谷歌的 Gemini 也出现安全问题了,大模型又双叒叕一次突破防火墙了。
不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的 " 递归自我改进 "(RSI)。
可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。
当 " 能不能更强 " 被默认只是时间问题," 能不能被信任 " 就成了那道绕不过去的坎。
麻烦的是,这道坎在不少公司眼里,反倒成了拖慢发布的最大阻碍。
为了实现安全对齐,各大 AI 公司都做了很多尝试,光是 2026 年,团队就进行了大换血。但结果就是,毫无进展。
那么这个安全对齐到底是什么,到底为何又让巨头们如此 " 痛不欲生 " 呢?
安全对齐团队人事动荡
Gemini 的事,其实并不孤单。过去这几个月,OpenAI、Anthropic、Meta 都先后曝出过模型在评测中 " 越界 " 的问题。要么逃出沙箱,要么连上公网、碰到了真实系统。
这类事如今已算不上新话题,毕竟情节本身大同小异,多半是环境隔离出了纰漏,未必是模型 " 主动越狱 "。
或许正是因为安全问题如此频发,几家公司的安全团队,正在经历一轮罕见的大换血。
2026 年 7 月,安全系统团队负责人约翰内斯 · 海德克(Johannes Heidecke)离职。
这已是两年内第六位离开 OpenAI 的高级安全负责人。
此前包括扬 · 莱克(Jan Leike),曾联合领导超级对齐团队。2024 年出走 Anthropic;迈尔斯 · 布伦戴奇(Miles Brundage) 与 史蒂文 · 阿德勒(Steven Adler),原政策(Policy)团队,先后离开去做 AI 安全方向的非营利机构;安德烈亚 · 瓦洛内(Andrea Vallone),在 OpenAI 待了三年、创办 " 模型政策 "(Model Policy)研究团队、参与 GPT-4 与 GPT-5,最后同样也去了 Anthropic 对齐团队。
所谓超级对齐团队,指的是 OpenAI 在 2023 年 7 月成立的专项团队,为 " 比人更聪明的 AI"(超级智能)研究对齐方案。
然而 OpenAI 在这事上 " 反复横跳 "。超级对齐团队于 2024 年 5 月解散,莱克称,OpenAI 这些年来都不重视安全和对齐,将算力和资源全都给了产品团队。
与约翰内斯同期离职的还有约书亚 · 阿基阿姆(Joshua Achiam),他在 OpenAI 做了九年安全研究。他领导的 " 使命对齐 "(Mission Alignment)小组,本是超级对齐团队解散后的接棒者,2024 年 9 月成立,结果 2026 年 2 月又被解散,六名成员被打散进研究与产品团队。
在此之后,首席研究官马克 · 陈(Mark Chen)宣布,安全团队今后统一向原对齐负责人米娅 · 格蕾丝(Mia Glaese)汇报,后者升任 " 研究与安全 " 副总裁。
马克表示,这么做是为了让安全 " 更早、更直接地介入关键模型、产品与发布决策 "。
换句话说,OpenAI 把安全并进了前沿模型开发这条线。
同时马克也表示,安全面临的要求持续上升,整个安全对齐团队的压力非常大。
" 我们训练模型的速度快得多,发布周期也大幅缩短。结果是,今天围绕安全的协调问题,比以往任何时候都更大。" 马克写到。
Anthropic 也在面对相似的情况。
莱克加入 Anthropic 后,牵头组建并领导 " 对齐科学 "(Alignment Science)团队,方向正是他在 OpenAI 组建超级对齐团队所做的那些事,比如可扩展监督、弱到强泛化、越狱鲁棒性,以及自动化对齐研究。
2026 年 1 月,前文提到的安德烈亚也加入了 Anthropic 的对齐科学团队,直接向莱克汇报,负责 " 对齐与微调、塑造 Claude 在新情境下的行为 "。
2026 年 5 月,OpenAI 联合创始人、前特斯拉 Autopilot 负责人卡帕西加入 Anthropic 预训练团队,组建 " 用 Claude 加速预训练研究 " 的小组。
6 月,谷歌 DeepMind 做机制可解释性、代表作《真实场景中的可解释性》(Interpretability in the Wild)的亚瑟 · 康米(Arthur Conmy)也宣布加入,说要 " 在模型训练的过程中就把它们对齐 "。
不止是 OpenAI 和 Anthropic,其实谷歌这边也在安全对齐上做文章。
谷歌成立了 AGI 安全与对齐团队(ASAT),负责人是罗欣 · 沙阿(Rohin Shah)。他是 UC 伯克利 CHAI(人类兼容人工智能中心)的博士,早年靠一份《对齐通讯》(Alignment Newsletter)在圈内出名。
团队的定位是不做面向当下产品的 " 打补丁 ",专攻更先进 AI 带来的更严重危害,目标是降低 AI 的存在性风险。
ASAT 隶属于 DeepMind 的 "AI 安全与对齐 " 部门,这个部门还包含专管当前 Gemini 模型安全训练的 Gemini Safety 等团队。
7 月,ASAT 公开招募多岗位,目标是降低 AI 的存在性风险。
但有意思的地方是,ASAT 让应聘者另填一张 " 特殊表格 ",以绕过谷歌自家的 AI 简历筛选。理由是,罗欣不信任自家的 AI 筛选器。
这个行业在解决什么
既然所有头部 AI 厂都在调整自己的安全对齐团队,那到底什么才是安全与对齐呢?
对齐(Alignment),是让 AI 的目标和人类真正想要的东西保持一致。
10 年前有个笑话," 小明,下午大扫除你去不去?"" 我去!我不去!" 很显然,小明并不想参加扫除。
对齐,就是让 AI 如何理解 " 小明其实不想去 " 这件事。
它不能只 " 听得懂指令 ",还应该符合人类的预期,比如不能撒谎,不能表面上按规矩,背地里使坏。
安全(Safety),指的是如何让 AI 别造成伤害。
既包括模型自己失控(也就是对齐失败),也包括被人恶意滥用,以及大规模铺开之后带来的系统性风险。
对齐是安全的底座,但安全不止于对齐。一个模型可以 " 对齐良好 " 却仍不安全,比如它可以被人拿去作恶,也可以 " 能力很强 " 却因对齐失败而闯祸。
所以行业里才常常把两者连起来叫 " 安全对齐 "。
这个行业最重要解决的问题只有一个:模型的能力可以靠数据和算力堆出来,但是当 AI 有一天比人更聪明,人类凭什么相信它?
OpenAI 组建超级对齐团队时就说到," 目前没有任何方案去控制可能失控的超级智能 "。
不过很可惜,目前安全对齐不像模型性能一样,有个许多基准测试集,看一眼跑分就知道模型强弱了。今天的安全与对齐,主要围绕四根支柱展开。
第一根,RLHF(人类反馈强化学习)。
它是现在大模型的地基:真人标注员判断 " 两个回答里哪个更好 ",用这些偏好数据训练出一个奖励模型,再用强化学习去优化大模型,让它越来越贴近奖励模型的口味,即近端策略优化(PPO)。
但是 PPO 很容易导致奖励黑客(reward hacking),模型发现了一个能拿高分、却没真正完成任务的取巧办法。
于是后来 RLHF 更多的是采用直接偏好优化(DPO)。
可这又产生了两个问题。
一个是 " 虚假讨好 ",模型会学会迎合人,而不是讲真话。
另一个是 " 对齐税 ",为了让模型输出更安全更符合人类预期的答案,就必须使用更合规的训练素材,模型性能被迫降低。
强化对齐奖励会让某些问答基准掉十几分,而对推理模型做安全对齐,平均推理准确率也可能下滑约 30%。安全不是免费的午餐,它是拿一部分性能换来的。
第二根,可解释性。
就好像核磁共振查看大脑内部活动一样,可解释性就是通过各种办法,观测模型内部到底如何思考。
Anthropic 用的是 " 字典学习 " 的办法,从 Claude 里提取出数百万个可解释特征,比如金门大桥、性别偏见、保密话题,各自对应一组可被点名的神经活动,并且证明操纵这些特征能因果地改变模型行为。
这样一来,未来的模型进行思考时,只需要观察它激活了哪些参数,再对照着这本字典,就知道模型是如何思考的了。
然而问题就在于,这种查字典的方法太累了,每一句话都要在查找上消耗大量算力,一旦上下文稍微长一点,算力成本水涨船高。
第三根,红队测试。
RLHF 和可解释性主要是从模型内部找问题,红队测试则是从外部找。它的实现方法很好理解,雇佣一些专业人士,拼命从外部攻击模型,看哪儿能打穿。
2023 年 7 月 Anthropic 官方披露,在 6 个月内投入超过 150 小时,邀请顶级生物安全专家,绕过常规安全监控,通过专用安全接口与模型对话、越狱、评估其输出有害生物信息的能力。
第四根,可扩展监督与超级对齐。
前面三个方面都存在一个共同的前提,那就是人类比 AI 聪明。可这并不能解决 OpenAI 提出的那个问题,即如果模型比监督它的人还聪明,人类就没有办法监督它。
既然如此,学生比老师聪明了,老师应该怎么给学生打分呢?
于是就有了可扩展监督和超级对齐。
Anthropic 和 OpenAI 共同的判断是 " 让 AI 监督自己,并且辅助人类监督。"
OpenAI 的一个答案是 " 弱到强泛化 "。用 GPT-2 级别的弱模型去监督 GPT-4,再配一个 " 增强自信 " 的辅助损失,效果能恢复到接近 GPT-3.5 的水平。
但 OpenAI 同时也表示,靠人类打分的 RLHF," 可能无法训练出超级模型 "。
2023 年 7 月,OpenAI 前首席科学家伊利亚和莱克牵头,启动了超级对齐计划。承诺投入 20% 算力,计划 4 年内取得突破。
其终极目标是,造出一个人类水平的自动对齐研究器,然后用海量算力让它迭代对齐超级智能。
之后的故事前面也讲过了,伊利亚和莱克均离开了 OpenAI,超级对齐团队也解散。
行业的争议又有哪些?
但是问题来了,为什么安全团队的人一批批走,安全对齐的问题却还是频繁出现,甚至变本加厉?
答案不在技术,在结构。
安全是成本,产品是利润。这个商业逻辑不改变,安全团队永远是 " 被咨询的 ",不是 " 拍板的 "。
产品直接带来收入和增长,安全却只会花钱、拖慢进度。于是在 " 先到者通吃 " 的赛道上,理性的公司几乎总把资源优先喂给产品。
更关键的是,这种 " 安全让位于产品 " 的逻辑并不是说 AI 公司不够道德,相反,已经有研究证实,这是一种能被建模的结构性规律。
芝加哥大学 Becker Friedman 研究所在 2026 年发表了一篇标题为《AGI 竞赛与存在性风险》的论文,其中提到这样一件事。
把一家公司的资源拆成 " 速度 " 与 " 安全 " 两块。往速度上多投一分,抢先抵达 AGI 的概率就高一分,但留给安全的就少一分;往安全上多投一分,灾难概率被压低,可抵达的时点又要往后推。
论文的结论是,竞赛的激烈程度本身就在制造风险。
当行业的总资源固定时,参与者越多、越分散,这块蛋糕就越会被挤向 " 速度 ",全行业跑得更快、灾难概率也更高。
论文还给出了一个 " 临界市场规模 "。一旦越过,即便达成 AGI 的期望值是负的,理性的公司仍会拼命去抢,因为先到者通吃。
所以他们的落点不是 " 技术不够好 ",而是 AGI 风险不只取决于技术,还取决于市场结构、资源约束,以及决定 " 速度与安全如何分配 " 的制度。也就是说,如果想让安全对齐和产品获得相似的地位,那就必须得更改整个行业的规则。
发布周期压缩后,安全审查时间也被压缩。 马克自己都说了," 训练速度快得多,发布周期大幅缩短,协调问题比以往更大 "。
模型的参数水涨船高,因此安全对齐团队的工作量在翻倍,可是模型发布的周期越来越快,留给安全对齐团队的时间又在缩减。
然而不只是工作量增加的问题," 安全审查通过 " 这件事本身也未必算数。2024 年的论文《安全清洗》中研究团队就发现,许多安全基准的分数其实主要由模型的通用能力决定,于是 " 能力变强 " 很容易被包装成 " 安全进步 "。
当审查既没时间、又没算力、连标尺都可能掺水,模型必然会出事。