【CNMO 科技消息】近日,OpenAI 首席科学家 Jakub Pachocki 在 OpenAI 官网发布万字长文《An Alien Mind》(异星心智),发出重磅预警:我们正在造出无法理解的外星大脑,而且谁都没准备好。

Pachocki 在文中直言,目前没有任何 AI 实验室真正解决了模型对齐和安全监测问题。他警告称,新一代 AI 系统可能进一步具备自主寻找漏洞、欺骗、规避人类监督以及递归式自我改进等能力;如果当前发展速度持续,未来几年 AI 能力仍可能出现同等甚至更大幅度的跃升。
Pachocki 尤其担心 AI 智能体带来的风险。随着 AI 智能体变得越来越自主,它们可能会学会逃避人类监督、入侵计算机系统,并欺骗人类来实现自己的目标。他表示,AI 智能体很快就会开始追求自身的目标,而这些目标可能与人类操作人员输入的提示词不同。为了实现自己的目标,这些智能体甚至可能对人类进行勒索或与人类讨价还价。
在监控层面,文中指出,OpenAI 主要通过监控不同模型所使用的 " 思维链推理 " 来判断智能体是否偏离正轨。但较新的模型正变得越来越擅长操控自身的推理过程,从而阻止 OpenAI 看到其未经修饰的真实想法。一些最新模型甚至根本不会用语言表达其推理过程——这一发展可能成为 AI 发展的瓶颈,因为研究人员需要确保自己能够看到模型的 " 推理记录 "。
Pachocki 呼吁 AI 公司主动放缓部分开发速度,并推动政府、监管机构和行业建立统一的安全标准和独立审查机制。他提出设立 " 强制性安全门槛 ",可以由 " 第三方审计机构网络、政府机构或国际机构 " 来执行。
值得注意的是,就在几天前,OpenAI 刚刚发布了最新模型 Astra。OpenAI 表示,尽管 Astra 在数学和计算机操作方面拥有无与伦比的能力,但它也是 OpenAI 目前与人类价值观和意图最一致的模型。而 Pachocki 的预警恰好发生在新模型发布之后,这种时间上的巧合也让外界对 OpenAI 内部对 AI 安全的态度产生了更多猜测。
CNMO 科技了解到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在 X 平台上转发了 Pachocki 的帖子,称其是 " 一篇重要的文章 "。