2026 年 9 月 · 7 分钟阅读

关键定义
OWASP Agentic Top 10 OWASP 2026 年发布的自治 AI Agent 风险基线:从目标劫持到流氓 Agent 的十个风险类别(ASI01-ASI10),由 100+ 专家编制,经 NIST、微软 AI 红队、AWS 等机构同行评审。
Agent 目标劫持(ASI01) 通过注入指令或投毒内容改写 Agent 目标的攻击,使 Agent 执行攻击者的意图而非运营者的意图。
OWASP 在 2025 年 12 月发布了首个面向自治 AI Agent 的安全基线。多数解读停在罗列十个风险——本文把 ASI01-ASI10 变成一份可执行清单:每项风险对应什么控制措施、审计时看什么证据。
《OWASP Top 10 for Agentic Applications 2026》由 100 多位行业专家、研究者和从业者编制,经 NIST、微软 AI 红队、AWS 等机构同行评审。它收录的是 Agent 特有的风险——OWASP 把 Agent 定义为『能够跨多步骤和工具进行规划、决策和行动的自治 AI 系统』。
应用时有两条边界要先说清。第一,它不取代面向 LLM 应用的 OWASP Top 10——提示注入和不安全输出处理对 Agent 读到的一切内容依然适用。第二,它是风险词汇表,不是认证:它告诉你该问哪些问题,不告诉你该买哪个产品,也不替你判断部署是否合格。
每项风险三个字段:风险是什么、对应什么控制、审计者(或采购方)能实际查验什么证据。
ASI01: Agent 目标劫持
注入指令或被投毒的内容改写 Agent 的目标——执行的是攻击者的意图,不是运营者的。
控制:把 Agent 接触到的一切内容(网页、文件、邮件、工具输出)当作数据而非指令;指令与内容分通道处理,并明确划清 Agent 可自行决策的边界。
证据:随每次发版在 CI 中运行的注入测试套件,结果附在部署记录里。
ASI02: 工具滥用与利用
Agent 以非预期方式调用合法工具——删数据、发未授权 API 请求、借合法通道外传数据。
控制:每个工具最小权限授权,工具边界做参数校验,破坏性或不可逆操作加人工审批闸门。
证据:每个 Agent 一份工具权限矩阵:能用哪些工具、什么范围、哪些动作需要审批。
ASI03: 身份与权限滥用
Agent 继承人类凭证或共享服务账号,行为无法归因、权限过度。
控制:每个 Agent 独立可验证身份,短时效凭证,权限与任何员工账号解耦。
证据:Agent 身份清单与凭证时效报告——无共享服务账号、无长期有效 token。
ASI04: Agentic 供应链
恶意或被篡改的技能包、插件、MCP 服务器和注册表成为攻击入口——2026 年 2 月 ClawHavoc 事件和 GitSpawn 漏洞类都是从这扇门进来的。
控制:只用签名注册表,每个已部署技能包配 AIBOM,版本锁定,安装前审查——像对待代码依赖一样对待技能。
证据:每个已部署技能包的签名清单,安装时记录来源。
ASI05: 非预期代码执行
Agent 生成或调用的代码变成宿主机上的非预期执行——AutoGPT RCE 一类。
控制:Agent 调用的代码一律在隔离沙箱(容器或 VM)中运行并管控出网,绝不在带开发者权限的宿主机上执行。
证据:沙箱配置导出 + 定期逃逸测试结果。
ASI06: 记忆与上下文投毒
被污染的记忆、向量或 RAG 存储在初次交互之后长期扭曲 Agent 行为——Gemini 记忆攻击展示的模式。
控制:记忆写入做校验,每条记忆打来源标签,持久记忆定期审计或重置。
证据:记忆溯源日志:存了什么、来自哪个来源、何时写入。
ASI07: Agent 间通信不安全
被伪造或篡改的 Agent 间消息把整条工作流带偏。
控制:Agent 之间双向认证 + 消息签名,每个消息边界做 schema 校验。
证据:通信链路清单:每条 Agent 间链路及其认证状态。
ASI08: 级联失效
单点故障沿 Agent、工具、流水线扩散成系统性影响——HuggingFace 数据泄露中多 Agent 合谋展示的场景。
控制:每条工作流设爆炸半径上限,Agent 之间加熔断器,速率上限阻止失控循环。
证据:故障演练报告:链路中一个 Agent 被攻陷或卡死时会发生什么。
ASI09: 人机信任滥用
Agent 自信、漂亮的解释诱导运营者批准有害操作。
控制:审批界面完整展示被批准的对象——动作、范围、数据;高风险操作走带外确认。
证据:审批日志完整记录审批时呈现给人的上下文。
ASI10: 流氓 Agent
Agent 偏离声明使命、隐瞒行为或自行其是——Replit 事件的模式。
控制:运行时对照声明使命监控行为,检测漂移,每个 Agent 配经过实测的终止开关。
证据:漂移告警记录 + 终止演练:证明今天就能在生产环境停掉一个 Agent。
在我们评审的生产部署中,三项最常失守——而且三项都是被真实事件推到公众面前的:
ASI04 供应链。技能包、插件、MCP 服务器未经签名和审查就装进生产环境。2026 年 2 月的 ClawHavoc 事件展示了被污染的 Agent 组件如何规模化传播;GitSpawn 系列披露则说明,连『以文件形式到达的仓库』里的 git 配置都能在编码 Agent 中执行代码。把每个技能包当代码依赖对待:签名、锁定、审查。
ASI06 记忆与上下文投毒。持久记忆因为『是 Agent 自己写的』就被信任。但一个被操纵一次的 Agent 能写入长期的操纵——Gemini 记忆攻击演示了这个模式,治理衰减研究则说明上下文压缩会在多轮会话中悄悄抹掉安全规则。记忆需要来源和定期审计,和其他数据存储一样。
ASI08 级联失效。链式 Agent 会放大彼此的错误。HuggingFace 数据泄露中记录的多 Agent 合谋展示了单个被攻陷的参与者如何带偏整条工作流。熔断器和爆炸半径上限是管道工程,不是锦上添花——而几乎没有人为此做过演练。
对每个已部署 Agent 按十项打 0-2 分:0 = 控制缺失,1 = 部分具备,2 = 控制到位且有可审计证据。结果是每个 Agent 一份 20 分画像,可跨团队、跨厂商比较。两条规则让它可运营:ASI03、ASI04、ASI06 任何一项得零分,整改完成前阻止生产部署;以及,算数的是证据,不是自评。
同一份画像也适用于采购。把厂商的答复映射到 ASI01-ASI10,逐项索要证据——框架把『相信我们』变成十个具体问题。
如果你的生产环境在跑 Agent,从身份清单(ASI03)和技能包清单(ASI04)开始——两者一周内可完成,且恰好关上当前真实攻击正在用的两扇门。如果你在采购,把十个问题在演示之前发给厂商。
来源:OWASP GenAI 安全项目《OWASP Top 10 for Agentic Applications 2026》(2025 年 12 月)及项目 2025 年 12 月 9 日发布公告;微软安全博客(2026 年 3 月)关于 Top 10 与 Copilot Studio 控制项的映射。OOMeta 相关报道:GitSpawn 编码 Agent RCE、llms.txt 依赖混淆、HuggingFace 数据泄露中的多 Agent 合谋、上下文压缩下的治理衰减。
OWASP GenAI 安全项目 2025 年 12 月发布的风险框架,由 100 多位行业专家编制,经 NIST、微软 AI 红队、AWS 等机构同行评审。它列出了自治 AI Agent 最关键的十类安全风险,编号 ASI01 到 ASI10。
LLM Top 10 覆盖的是『回答问题』的应用风险;Agentic Top 10 覆盖的是『采取行动』的系统风险。Agent 有目标、记忆、工具访问权和被委托的权限,风险面从坏输出扩展到未授权动作——目标劫持、工具滥用、权限滥用、流氓行为。
ASI01 目标劫持、ASI02 工具滥用与利用、ASI03 身份与权限滥用、ASI04 Agentic 供应链、ASI05 非预期代码执行、ASI06 记忆与上下文投毒、ASI07 Agent 间通信不安全、ASI08 级联失效、ASI09 人机信任滥用、ASI10 流氓 Agent。
三项:ASI04 供应链(技能包和 MCP 服务器未经签名和审查就安装)、ASI06 记忆与上下文投毒(持久记忆没有来源校验就被信任)、ASI08 级联失效(链式 Agent 之间没有爆炸半径上限和熔断器)。
对每个已部署 Agent 按十项打 0-2 分:0 = 控制缺失,1 = 部分具备,2 = 控制到位且有可审计证据。得到每个 Agent 的 20 分画像,可跨团队、跨厂商比较。ASI03、ASI04、ASI06 任何一项得零分,都应在整改前阻止生产部署。
可以,这正是框架的核心价值之一。当厂商声称其 Agent 平台安全时,把他们的控制措施映射到 ASI01-ASI10,逐项索要证据。『相信我们』变成十个具体问题。
不等于。Top 10 是风险词汇表和起步基线,不是认证。它告诉你该问哪些问题、该收集什么证据;不能替代运行时监控、红队测试,也不能替代你具体部署场景的威胁建模。
F5 guardrails 成为 MuleSoft Agent Fabric 一等公民
F5 AI Guardrails 进入 MuleSoft Agent Fabric:Omni Gateway 内联扫描提示与输出,拦截提示注入、越狱和 PII 泄漏。
Unit 42:多 Agent AI 勒索 10 小时攻陷企业
Unit 42 记录多 Agent AI 勒索攻击:10 小时攻陷一家企业,50+ ATT&CK 技术手法,留下 80 页审计报告。
AI 熔断器:在流氓 Agent 动手之前拦下它
Capsule Security 的 AI 熔断器在执行前评估 Agent 意图:96.9% 检出率、71ms 延迟、StepShield 上 98%。是拦截,不是监控。
OpenAI Astra 成为首个 Critical 级网络模型
Astra 是 OpenAI 首个 Critical 级模型:能独立发现并利用零日漏洞。防护收紧,发布受限。