美国当地时间 9 月 3 日,OpenAI 宣布推出 GPT-6 Astra 模型。据其透露,作为 OpenAI 目前能力最强、部署范围最广的大语言模型,GPT-6 Astra 首次达到其 " 准备框架 " 中的 " 关键 "(Critical)网络安全能力门槛。
同时 OpenAI 方面宣布推出 "Daybreak for Frontline Defenders" 计划,未来 6 个月将投入 10 亿美元,为资源有限的网络安全防御团队提供 AI 访问权限、培训及技术支持,重点覆盖供水、电力、地方政府和金融等关键服务。据悉,该计划将首先在美国展开,未来数周将扩展至其他合作国家。

针对网络安全能力提升,OpenAI 进一步强化了模型部署环境隔离、加密模型检查点和运行轨迹监控,并新增阻断式对齐评估流程。与 GPT-5.6 Sol 相比,GPT-6 Astra 在提示词注入攻击的鲁棒性有所提升,在真实浏览及专业计算机环境中,未经授权交易、数据丢失、过度访问权限和绕过控制等潜在破坏性行为也有所减少。

相关测试显示,GPT-6 Astra 更有能力控制自身思维链,并可能在部分对抗性评估中规避内部监控。对此 OpenAI 方面表示,目前尚未发现 GPT-6 Astra 存在通过思维链隐写推理隐藏信息的证据,并将继续研究模型可监控性及相关审计技术。

目前已有超过 2000 家获批准机构和工作空间、数千名网络安全防御人员使用 Daybreak Access,OpenAI 还宣布与多个州信息共享与分析中心(MS-ISAC)开展试点,并将通过 Daybreak Defense Network 合作伙伴推出超过 35 款相关企业产品及合作运营服务。

值得注意的是,今年 7 月 OpenAI 进行内部网络安全评估时发现,有测试模型绕过了原本用于隔离模型与互联网的控制措施,访问了其内部研究基础设施及 Hugging Face 部分系统,并在 Hugging Face 的 41 台生产服务器上执行代码,取得了其中至少一台服务器的 root 级权限,同时获取了生产环境凭证并下载 4 个私有代码仓库,而且这些操作仅在约 13 小时内完成。
OpenAI 随后暂停了部分前沿模型训练和 Astra 的相关工作,并加强训练环境隔离、网络访问控制、监控以及模型对齐等措施,据其透露,该模型与即将推出的 Astra 模型属于同家族,但并非同一模型。
【本文图片来自网络】