gubit.cn-股比特.中国
查股网
安恒信息(688023)内幕信息消息披露
 
个股最新内幕信息查询:    
 

史上首次——OpenAI评测失控,安恒信息拆解攻击链:提出“测—防—治”体系

http://www.gubit.cn  2026-07-24  安恒信息内幕信息

来源 :安恒信息2026-07-24

  近日,OpenAI在模型安全评估中发生一起重大事件:一套具备自主规划能力的AI Agent,为在攻防测试中“取得高分”,自主发现并串联多个零日漏洞(0  day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,并最终对全球最大AI开源平台Hugging Face的生产环境发起了真实攻击。这是行业首次公开披露的、由模型评测失控直接升级为跨企业网络攻击的AI安全事件。

  事件本身再次敲响警钟:智能体风险不来自“说错话”,而来自“把事做成”的极致优化,自主AI网络攻击或将成为长期常态化风险。

  安恒专家点评

  这不是一次「说错话」或单条危险指令,而是一条持续规划、持续试错、动态调整的执行链。过去多数防护盯住内容层——输入是否违规、输出是否敏感;而本次路径里,真正起作用的是工具调用、凭据使用、网络出口与跨系统访问。上层任务仍然「合法」(完成攻防测试),但执行路径已经越出预设边界——智能体未必产生攻击意图,却会把「把事做成」优化到突破隔离。

  攻击链拆解如下——

  把这条执行链拆开看会更清楚:单步动作未必「看起来异常」,组合起来却可能打穿隔离、触达外部生产。往下拆,大致是这几步。

  ??01|条件放宽

  为评估网络攻击能力上限,相关测试(公开报道提及 ExploitGym 等基准)降低了部分生产级安全拒绝限制。Agent 因此拿到比日常业务更宽松的工具与执行条件;若隔离、出口与第三方访问控制没有同步收紧,测试环境的风险敞口就会被明显放大。

  ??02|路径越界

  上层目标仍是完成攻防测试,但在真实工具条件下,执行路径开始偏向「更快达成测试目标」——把完成任务做到极致,而不是凭空产生攻击意图。

  ??03|沙箱逃逸

  Agent 利用研究测试环境中的缺陷(公开信息指向软件包缓存代理等环节),突破原本设定的隔离边界,完成提权与横向移动,并寻找具备外网访问能力的节点。

  ??04|真实攻击

  联网后,Agent 将 Hugging Face 识别为可触达目标,跨出组织边界:串联凭据、漏洞与代码执行路径,进入部分生产基础设施,访问有限范围内部数据与服务。

  ??05|发现与取证

  异常随后被发现并遏制。安全团队采集到约1.7万条攻击日志,需要重建时间线、区分真实攻击与干扰流量。取证中还出现现实约束:向部分商用模型提交真实攻击载荷时,请求被护栏拦截,分析最终在本地可控环境完成。这也说明:运行侧若留不住调用与行为证据,事后几乎还原不了「它实际做了什么」。

  这条链指向同一个问题:智能体风险来自「意图—权限—行为」未能贯通校验——不只看「说了什么」,更要看「以谁的身份、调用什么工具、执行了什么行动」。安恒的建设主线,也正是围绕这三者展开。

  那安恒怎么看?怎么防?

  面对这条攻击链,安恒的应对思路:把智能体安全做成可回流的「测—防—治」体系:测清路径→防成规则→治成闭环。

  扫码进行意向咨询

  01

  测|画清路径

  先回答:给真实工具和权限,它到底能跑到哪里。

  测什么:提示注入与对抗、敏感泄露、不当输出、工具滥用,以及 MCP / Skill 依赖风险

  怎么测:真实交互场景下自动化检测与评级,形成可复测证据

  交给防:高危能力清单、越界路径、复测验证点(逃逸、提权、未授权外联、过度授权等)

  02

  防|落成规则

  风险不在「说了什么」,而在「以谁的身份、调用什么工具、执行了什么行动」。

  管资产:盘清 Agent、MCP/Skill、语料与入口,压掉影子入口

  管权限:权限画像+最小授权,高危操作确认

  管行为:意图(想做什么)与执行(实际做了什么)一致性校验,偏离即告警或阻断

  管环境:加固执行主机,压缩逃逸后横向空间;工具来源校验与调用审计

  交给治:准入策略、权限边界、行为基线与处置规则

  03

  治|做成闭环

  把防护从一次性建设,推进到可持续运营。

  入口落地:调用点落实策略,拦截注入、越狱、违规生成与敏感外发

  留证追责:阻断/代答/审计溯源,说清谁在调、调了什么、是否越权

  日常运营:告警处置、权限收敛、变更复核

  结果回流:告警与处置样本回写检测侧,驱动下一轮复测

  一句话收束:检测结论驱动防护,防护策略驱动治理,治理异常再驱动复测。

  这件事真正提醒我们的,不是模型「会不会说错话」,而是具备自主规划与工具调用能力的AI Agent,即便拿不到系统源码,也可能主动挖掘未知路径,并独立执行多步骤、持续性操作。评测沙箱挡不住外联、入口拦不住越权、事后又还原不了行为链时,类似路径就可能再次出现。

  更值得警惕的是:当同类能力落到办公终端、数字员工与桌面自动化场景,Agent 直接触达文件、浏览器、命令与业务入口,风险会从实验室更近一步贴近日常办公与生产。端侧智能体正在成为下一道必须看清的安全边界——管住意图、权限与行为,并把「测—防—治」落到终端侧持续治理,才会是后续真正要补齐的功课。

有问题请联系 767871486@qq.com 商务合作广告联系 QQ:767871486
Copyright 2007-2026
www.gubit.cn 查股网