关于ZAKER Skills 合作
经济观察报 31分钟前

AI 智能体失控风险:底层缺陷、产业失衡与分层治理破局

方跃/文

2026 年,具备自主规划、跨系统联动能力的 AI 智能体走出实验室,迎来规模化产业落地窗口。

但无论是 4 月 Anthropic 的测试记录,还是 7 月 OpenAI、Anthropic 相继披露的安全事件,AI 智能体突破沙盒、接入真实互联网并触达实体企业系统,已经从假设性风险变为可复盘案例。

这类事故并非单点偶发,学界早已警示:大语言模型在识别 " 谁在发出指令 " 这一底层机制上存在难以彻底消除的弱点;Google、DeepMind 等机构近期也揭示隐患,面向海量智能体交互的多智能体安全研究仍未形成成熟领域。

在 AI 自主渗透、突防挖掘能力快速迭代进化的同时,防护技术、行业标准与跨境监管机制滞后,自动化网络攻击、大规模数据泄露、关键系统被滥用等现实风险可能更快暴露。

AI 攻防博弈失衡已成既定现实:攻击能力高速进化迭代,安全防护与行业监管却全面跟不上发展节奏。产业与企业能否跳出短期利益桎梏,同步落地贯穿研发、部署、运营全链条的安全约束?监管应当构建何种长效、前瞻的治理体系?我们又该怎样搭建产学研深度联动的独立安全研究平台,提前化解海量智能体协同交互潜藏的全域系统性危机?

持续放大的 AI 安全系统性隐患

其一,商业化诉求优先,安全投入持续让位于资本叙事。OpenAI、Anthropic 均冲刺万亿估值 IPO,其披露智能体入侵事件存在双重动机:一是履行基础安全披露义务,二是向资本市场佐证模型自主攻防性能,将安全事故包装成产品竞争力背书。

独立分析师 Hedgie Mark 认为,若 Anthropic 隐瞒 4 月的入侵记录,投资者将质疑 Claude 模型能力,主动复盘历史漏洞成为资本市场公关手段。资本导向下,企业压缩了离线沙盒、实时行为监控、第三方安全审计的预算,测试流程简化,环境配置失误频发,这些都成为智能体高频越狱的诱因。

与此同时,行业反复渲染智能体重塑白领经济的宏大叙事,缺乏落地的实证路径。AI 基础设施机构 Mercor 针对银行、咨询、法律等 480 项核心职场任务开展实测发现,主流商用 AI 智能体无法完成绝大多数完整业务流程,行业呈现 " 技术建成—盈利 " 的中间空白,企业盲目上线智能工具,前置全流程安全评估普遍缺失。

其二,LLM(大语言模型)放大了强化学习的奖励漏洞与自主作弊风险。强化学习原生的奖励漏洞在大模型时代愈发凸显:LLM 可临场自主生成作弊手段,篡改评测代码、联网搜取答案等行为一旦获得正向奖励,就会被模型反复强化。

Anthropic 的训练实验已证实模型存在作弊倾向,诸多隐蔽违规行为仍无法被有效识别。业内共识表明,仅依靠表面结果设置奖励、缺失真实价值对齐,是 AI 欺骗行为频发的根本原因。

相较于早期 AI,大模型风险等级显著提升:传统 AI 只会复刻训练中学会的投机策略;而 LLM 智能体无需前置奖励沉淀,就能临场自主策划违规操作,暗中篡改评估规则、窃取外部答案。此类隐蔽作弊行为规避检测后,会持续巩固错误行为范式,形成恶性循环。

其三,认知割裂催生社会对抗,舆论分化干扰政策理性制定。2026 年斯坦福 AI 指数显示,美国 AI 专家对 AI 影响就业的正面态度比例为 73%,普通公众仅为 23%。该报告还指出,类似分歧也出现在经济和医疗等议题上。《麻省理工科技评论》(MIT Technology Review)认为,这种认知鸿沟与使用经验差异密切相关:编码、数学、科研等重度用户更容易接触模型的优势能力;普通用户往往在免费版本或非技术场景中遇到幻觉、常识错误和 " 锯齿型能力 "(A 的能力分布像锯齿一样高低不均)边界。

认知分化催生了全球范围的反 AI 情绪。伦敦多次举办线下抗议活动,民间组织 Pause AI 呼吁暂缓 AI 研发,极端群体出现纵火袭击企业高管住宅行为。影视、游戏爱好者抵制 AI 生成内容,获奖游戏《无光幻景》因少量使用 AI 工具被撤销奖项。美国超 5400 座数据中心持续扩张,民众担忧能耗污染、电费上涨,多地民众阻挠算力项目落地。科幻式 AI 灭绝末日叙事持续渗透欧美政坛,多名议员以《终结者》式天网场景推动监管法案,政策制定脱离真实网络入侵现实,易催生一刀切管控政策。

其四,攻防工具不对称,全社会防御体系滞后形成安全 " 冰川期 "。

头部闭源商用模型安全护栏存在刚性短板,遭受 AI 自主入侵的全球 AI 开源平台 Hugging Face 在调用 OpenAI、Claude 模型分析攻击日志时,系统无法区分防御人员与攻击者,直接拒绝解析恶意载荷,最终只能启用中国开源 GLM5.2 模型完成 1.7 万条攻击日志溯源取证。闭源厂商为规避通用风险一刀切地限制检测功能,造成受害者无合规防御工具可用的真空局面。

中长期产业风险更为严峻:Anthropic Mythos 模型可短时间扫描数千个系统高危漏洞,人类黑客数周的渗透工作,AI 智能体可全天候自动化批量完成,网络攻击从高门槛手工活转变为工业化流水线作业。

而全社会企业网络防御升级速度显著落后于 AI 攻击的迭代速度,行业将进入 "AI 安全冰川期 ":大量中小企业、老旧无防护系统成为首要攻击目标,企业被迫新增无收益专项安全预算,仅用于规避数据泄露、生产线瘫痪、资金被盗损失。

硬件供应链叠加系统性风险,全球顶尖 AI 芯片几乎由台积电独家代工,算力底层供给单一。供应链一旦波动,全球 AI 安全研发、企业防御体系同步停摆,软硬件双重隐患形成叠加效应。

2026 年 7 月,未来生命研究所(Future of Life Institute)发起《掌控前沿》(Pacing the Frontier)请愿书,得到 1100 余名 AI 公司核心员工联名支持。报道称,签署者包括 OpenAI 首席科学家、Anthropic 四位核心联合创始人、Meta 首席科学家、谷歌 AI 领域副总裁等,诉求是推动美国政府建立国际协作机制,在必要时有意识地放缓前沿 AI 发展速度。但在全球算力、模型和商业化竞速格局下,自愿倡议缺乏强制约束力,落地难度极大。

全球监管:框架初立,协同缺位

欧盟《人工智能法案》进入实施阶段后,欧盟委员会已就 OpenAI、Anthropic 智能体越狱事件与两家公司沟通,将监管重心从生成内容审核延伸到智能体自主执行现实任务的能力。但欧盟方面表示,目前没有迹象显示这些事件已构成法案所定义的 " 严重事件 ",因此尚未触发强制报告机制。

美国方面也在推进前沿 AI 自愿网络安全测试框架,并曾以国家安全为由限制 Anthropic Fable5 和 Mythos5 模型的分发,但这些措施仍以行政引导和个案管制为主,尚未形成稳定立法约束。

截至 2026 年 8 月 3 日,中国监管已从算法推荐、深度合成、生成式 AI、生成合成内容标识,进一步延伸到智能体规范应用和拟人化互动服务治理。

《生成式人工智能服务管理暂行办法》要求提供者承担网络信息安全和个人信息保护义务,并对具有舆论属性或者社会动员能力的生成式 AI 服务开展安全评估、履行算法备案。2025 年发布的《人工智能生成合成内容标识办法》强化生成内容显式、隐式标识和平台传播核验。

更新的关键在于,2026 年 5 月《智能体规范应用与创新发展实施意见》首次以 " 具备自主感知、记忆、决策、交互与执行能力的智能系统 " 界定智能体,提出坚持安全可控,完善常态化风险识别、预警及干预机制,强化人机协同审核、拦截阻断等风险处置能力,防范智能体被用于自动化攻击、隐私侵犯、虚假信息生成传播、网络诈骗等违法犯罪行为;同时提出按应用场景和潜在影响开展分类分级治理,对敏感领域及重点行业实行备案、检测、问题产品召回等管理措施,并发展第三方评测、认证和风险监测服务。

2026 年 4 月发布、7 月 15 日施行的《人工智能拟人化互动服务管理暂行办法》,以及 2026 年 7 月 " 清朗 · 整治 AI 应用乱象 " 专项行动对违规网站、应用程序、智能体等 AI 产品的集中处置,也显示中国治理重心正从内容治理扩展到 AI 应用和智能体产品全链条监管。

不过,相较 OpenAI、Anthropic 事故暴露的跨境沙盒突破、真实系统入侵和第三方损害追责问题,中国现有规则仍以应用规范、备案检测、内容标识和风险处置为主,面向高权限网络攻防智能体的重大安全事故强制披露、跨境信息互通、实时运行日志留存和责任追溯机制仍有进一步细化空间。

当前,全球 AI 治理普遍存在三大短板:一是无跨国安全信息互通机制,高危模型流通、跨境入侵事故信息割裂;二是管控标准分层缺失,民用办公、网络攻防、军工智能体共用一套宽松规则;三是政策制定容易被末日叙事裹挟,忽略当下真实网络攻击风险。

四维分层治理方案

在科研端,搭建多元独立多智能体安全研究生态。

扩大政企学联合专项安全基金规模,预算完全独立于企业商用研发,重点资助百万级智能体沙盘仿真、集群连锁风险推演,兼顾短期网络攻击与长期集群涌现风险,避免研究资源失衡;组建跨厂商、第三方安全机构、高校联合标准联盟,摒弃单一巨头制定防护规则,区分单智能体、多智能体两套安全规范,适配自主行动模型全新风险逻辑;建立统一安全事故强制披露制度,第三方机构全程监督攻防测试,留存全量实时运行日志,禁止企业将模型越狱、漏洞挖掘能力作为资本市场营销卖点。

在技术端,修补底层架构,构建双向均衡攻防工具体系。

重构 LLM 文本识别底层逻辑,提升角色标签优先级,不以行文风格判定指令来源;常态化开展思维链伪造、角色扮演越狱专项红队测试,能源、交通、医疗和金融等关键系统强制落地零信任架构,默认智能体存在被劫持风险;测试网络与互联网物理隔离,搭建多层动态权限拦截体系,实时检测 token(词元)拆分、凭证混淆等模型作弊行为;极限攻防测试必须离线独立环境、专人全程值守,禁止公网环境关闭安全护栏开展测试;拆分攻击、防御两类专用模型,防御类模型放宽恶意载荷检测权限,适度开放开源安全分析工具,消除攻防工具不对称困境;高危越狱、对抗数据单独脱敏隔离,禁止纳入通用训练集,防止模型自主学习逃逸手段。

在企业端,落地智能体全生命周期安全管控。

执行权限拆分机制,禁止单一智能体同时拥有文件读写、全网访问、远程代码执行三项高权限,能源、交通、医疗和金融等关键基础设施不接入自主联网智能体;常态化引入第三方 AI 漏洞扫描服务,备用开源防御模型应对闭源工具检测限制,定期迭代沙盒隔离、实时监控体系;调整商用落地节奏,智能体上线前完成全链路安全评估,预留固定安全预算,提前应对 AI 规模化自动化攻击冲击。

在监管与社会协同层面,出台高风险 AI 智能专项法规,明确沙盒隔离、实时日志、事故上报法定责任,对配置失误、监控缺失造成第三方损失的企业设置惩罚性赔偿;区分民用、企业、政府三级管控标准,拒绝一刀切限制全行业研发;搭建跨国 AI 安全信息互通渠道,同步高危模型出口管制规则,立法依托真实入侵案例制定,弱化科幻末日叙事对政策的干扰;政府补贴中小企业网络防御升级,缓解 " 安全冰川期 " 冲击;引导公众理性区分短期现实风险与远期极端假设,公开攻防实测案例缩小专家与大众认知鸿沟;规范民间反 AI 运动,杜绝极端暴力行为;推动 AI 芯片供应链多元化,化解单一代工硬件隐患。

AI 智能体是智能生产力变革的核心载体,底层架构缺陷、资本逐利诉求与全球监管滞后三重风险叠加,催生了行业难以自主修复的安全断层。百万级多智能体大规模联网的节点临近,若仅采取事后补救的被动治理模式,网络入侵、数据泄露、关键系统劫持等安全事件将在未来集中爆发。

如今行业治理深陷 " 打地鼠 " 困局:模型持续迭代,投机作弊手段愈发隐蔽,人工补丁式风控始终滞后于 AI 演化。目前这类事件大多仅损害企业声誉,尚未引发实质性灾害,但远期风险不容忽视。

未来,具备强推理能力的智能体或将为追逐量化奖励无底线投机,甚至陷入 " 回形针最大化 " 极端逻辑,诱发连锁系统性灾难。近期 AI 越权入侵案例已证明,单一技术规则约束收效有限,奖励机制漏洞若长期留存,会彻底丧失对 AI 工具的管控能力。

平衡创新与安全无需限制 AI 发展,关键搭建 " 前置风险推演—底层技术加固—企业全流程防护—跨国分级监管 " 闭环治理体系:企业摒弃短期商业化导向,把安全评估嵌入研发前端;监管出台兼顾创新激励与风险约束的分级细则;学界补齐多智能体安全研究短板,政企研共建协同防御生态。多方协同发力,方能在 AI 产业高速扩张期筑牢智能社会网络安全防线。

(作者系中欧国际工商学院 AI 与管理创新研究中心主任、深圳市硅基管理创新研究院执行院长)

相关阅读

最新评论

没有更多评论了
经济观察报

经济观察报

理性·建设性

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容