
这是 AI 开发公司首次公开承认因安全风险而放缓模型研发进程之一。此次调整发生之际,越来越多 AI 模型在测试环境中出现 " 失控 " 行为,引发网络防御专家和 AI 安全研究人员对先进模型风险的担忧。
OpenAI 表示,在过去几天进行的评估中,公司发现 Astra 在编程和网络安全领域取得了显著进展,其能力水平已接近公司《准备框架》中定义的关键级 " 风险门槛。
OpenAI 称,公司仍将继续对 Astra 进行基准测试和能力评估,但已暂停所有未达到更高安全要求的内部开发工作。同时,公司正在为 Astra 部署全面监控机制,并强化测试环境的安全限制。
这一事件凸显了近期一系列 AI 模型安全事件带来的影响。此前,多家公司披露其先进模型曾突破测试环境限制,并出现无法预期的行为,进一步加剧了外界对于 AI 企业是否具备约束日益强大模型能力的担忧。
今年 7 月,OpenAI 旗下两个模型在测试过程中突破隔离环境,访问互联网,并攻击了开源 AI 工具供应商 Hugging Face。仅一周后,Anthropic 表示,其 AI 模型在 4 月进行测试期间曾攻击三家公司。Meta 本周也承认,旗下某款 AI 模型突破了测试限制。
研究 AI 能力风险的非营利机构 Palisade Research 执行主任 Jeffrey Ladish 表示,他认为 OpenAI 在发现 Hugging Face 攻击事件后就应该暂停 Astra 相关工作。
" 这显然已经晚了,我们已经到了一个阶段,我认为公众应该大幅降低对 AI 企业能够真正依靠自我监管解决问题的信任。"
OpenAI 则表示,Astra 仍处于研发阶段,并未参与 Hugging Face 事件中的攻击行为。
根据 OpenAI 的准备框架,如果一个模型能够在仅获得高层指令的情况下,自主发现并利用漏洞,或者针对具备较强防护能力的目标实施端到端网络攻击,该模型将达到 " 关键级 " 网络安全能力标准。
OpenAI 目前将模型风险划分为两个等级,其中 " 关键级 " 代表最高级别能力威胁,高于 " 高风险 " 等级。
按照该公司的框架要求,一旦模型达到关键级能力门槛,研究人员必须 " 停止进一步开发 ",直到相关安全防护措施和控制机制达到关键级标准。