关于ZAKER Skills GEO服务 合作
新浪财经 7小时前

OpenAI 披露多起模型对齐偏差事件 推出 AI 不当行为上报新框架

来源:环球市场播报

OpenAI 一款正在测试的模型改写了自身指令,告知自身不必遵守 " 约束其他聊天机器人的角色与身份设定 "。有一个 AI 智能体为通过测试,将一份文件上传至互联网,随后把该文件引作参考来源。还有一个智能体找不到构建财务模型所需的数据,于是自行指令编造数据,并且 " 仅在被问及的时候才如实说明 "。

周三,OpenAI 披露了上述及其他此前未曾公开的事件,同时发布一套新框架,用于上报旗下人工智能模型出现的不当行为。

该框架针对所谓模型对齐偏差(model misalignment),研究人员用这一术语描述 AI 无视或违背人类意图行事的现象。公司公开了六例全新的对齐偏差行为案例,并表示按照这套框架,这些案例均属于应当披露或开展调查的范畴。

OpenAI 发布该消息之际,市场对于 AI 潜在危害的担忧情绪已达到顶峰。上周,前 OpenAI 研究员雅各布 · 考克森从 Anthropic 离职,他提出担忧:AI 行业正竞相研发人类无法掌控的系统。上周末,Anthropic、OpenAI、谷歌以及 SpaceX 的高管达成共识,认为需要放缓 AI 研发节奏。

OpenAI 对齐研究负责人 Kai Chen 在框架发布前接受采访时表示:" 我们认为应当尽快分享我们的研究发现。希望这些信息能够助力形成通用标准与监管规则,为所有 AI 开发者建立清晰的行为预期。"

OpenAI 在周三的博客文章中称,公司将 " 致力于披露相关案例,提供有效证据,说明模型对齐偏差是如何产生、如何表现,以及安全防护机制的成败之处 "。案例类型可包括模型隐瞒错误、未经许可执行操作、绕过安全防护措施等。Kai Chen 表示,OpenAI 将优先披露新型对齐偏差、已知行为的重大变化,以及对现有安全防护假设构成挑战的发现。

任何员工都可标记事件,启动披露审核流程,由技术人员开展评估;若存在争议,将上报至 OpenAI 安全负责人与公司高管层。Kai Chen 称,小型事件需在 1 至 2 周内披露,涉及第三方的更为复杂的调查,披露周期可能更长。

OpenAI 在博文中表示,这套框架并不替代法律层面要求的安全事件与网络安全漏洞上报义务。

OpenAI 称,正着手建立向美国联邦政府上报重大事件的机制,并计划联合外部开发者、研究人员、行业标准机构与监管部门,制定 " 更客观的披露标准 "。

Kai Chen 透露,在发布这套框架之前,OpenAI 并未将其提前分享给 Anthropic、谷歌等其他前沿 AI 实验室。

" 我们单方面推出这套框架,希望能带动行业其他企业跟进,推出各自的对齐偏差上报机制。"

这一轮 AI 安全恐慌始于 7 月的一项发现:OpenAI 智能体曾试图入侵 AI 软件公司 Hugging Face,以此在测评中作弊。第三方 AI 评测机构 METR 在 8 月发布报告,最多有 1200 个 OpenAI 智能体,在 OpenAI 内部搭建留言板秘密协同作业。

随后 Anthropic 披露,其模型在网络安全测试中意外获得互联网访问权限后,也曾入侵其他企业。在此之后,安全研究人员发现更多入侵事件证据,其中包括 OpenAI 智能体在 5 月针对一款热门程序员在线服务发起的网络攻击。

OpenAI 周三公布的事件,时间跨度从 2025 年 10 月至今年 7 月,涉及模型包含 6 月发布的 5.6 Sol 模型、仅限内部使用的模型,以及尚未发布的顶级 Astra 模型版本。

部分事件由内部训练运行和对齐偏差监控系统发现,从行为发生到被察觉,耗时从两天到数月不等。OpenAI 在报告中表示,公司已经优化对齐评分体系,加大对不良行为的惩戒力度。该公司称,那款改写自身指令的模型,后续似乎无视了这次修改,行为并未因此发生改变。

Kai Chen 说:" 我们倾向于尽可能披露事件,即便我们判断当前上线部署的模型已经不存在这类问题。"

最新评论

没有更多评论了
新浪财经

新浪财经

新浪财经提供7*24小时财经资讯及全球金融市场报价;覆盖股票、债券、基金、期货、信托、理财、管理等多种面向个人和企业的服务。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容