2026 年 7 月 18 日 · 7 分钟阅读
2026 年 7 月,Anthropic 副 CISO Timothy Morano 发布了一个简洁但深刻的框架,用于评估 Agentic AI 的风险。这不是一个几十页的技术架构清单,而是四个问题——从"Agent 能做什么"出发的治理思维框架。这四个问题直击 Agent 风险的本质,帮助企业在部署 Agent 之前回答最关键的问题。

关键定义
Anthropic CISO 发布 Agentic AI 风险四问框架 2026 年 7 月,Anthropic 副 CISO Timothy Morano 发布了一个简洁但深刻的框架,用于评估 Agentic AI 的风险。这不是一个几十页的技术架构清单,而是四个问题——从"Agent 能做什么"出发的治理思维框架。这四个问题直击 Agent 风险的本质,帮助企业在部署 Agent 之前回答最关键的问题。
在这个框架发布之前,Agentic AI 的风险评估方法大致分为两类:一类是过于技术化的架构检查清单(如 OWASP 的 10 大 Agentic 风险),另一类是过于抽象的治理原则(如"确保 AI 系统安全")。前者缺乏战略视角,后者缺乏可操作性。
Anthropic 的 CISO 团队采取的是一条中间路径——四个问题,每个问题代表一个独立的风险维度。这不是替代技术检查清单,而是为技术检查清单提供战略上下文。企业应该先用这四个问题建立风险认知,然后再深入具体的技术控制措施。
第一个问题也是最基础的问题。不是问"Agent 有什么能力",而是问"我们信任 Agent 做什么"——这是一个权限问题。
关键区别在于:能力是 Agent 可以做的事(模型的技术上限),信任是企业允许 Agent 做的事(治理边界)。两者之间的差距就是风险敞口。
Morano 强调:这个问题的答案不能是"所有必要的权限"。如果答案是"所有必要的权限",说明你没有真正思考过信任边界。每个权限都应该有明确的理由和上限。
第二个问题关注 Agent 的运行上下文。同样的 Agent,在不同的环境中,风险水平完全不同。
这个问题的意义在于:许多 Agent 风险不是因为 Agent 本身有问题,而是因为 Agent 被部署在了不适合的环境中。一个在隔离测试环境中安全的 Agent,进入生产环境后可能变得危险——不是因为 Agent 变了,是因为环境变了。
第三个问题是最常被忽略的。企业倾向于问"Agent 会正常工作吗",但很少问"如果 Agent 出错,最坏能坏到什么程度"。
这不是悲观主义——这是风险管理的基本功。每个 Agent 都应该有一个明确的"最坏情况分析":
Morano 指出:如果最坏情况的严重程度超出了企业愿意接受的范围,那么就不应该让 Agent 在没有额外防护措施的情况下运行。这个结论听起来简单,但很多企业是在 Agent 出事后才意识到"最坏情况"有多糟糕。
第四个问题关注运行时控制和可观测性。无论你在前三个问题上做了多少准备,Agent 仍然可能以你未曾预料的方式行为。
这个问题的核心是:不要假设 Agent 会一直按预期工作。要有检测能力、停止能力和恢复能力。
四个问题的框架之所以有价值,是因为它改变了评估 Agent 风险的方式。传统的风险清单问的是"Agent 有什么能力"——这是一个技术问题。Anthropic 的框架问的是"Agent 应该被允许做什么"——这是一个治理问题。
区别很微妙但很重要:能力是技术上限,信任是治理边界。当治理边界清晰时,技术能力就不再是风险——它是一个已知变量。
这个框架也不是一次性的。随着 Agent 的能力提升、部署范围扩大、环境变化,四个问题的答案都需要重新审视。Agent 治理不是一次审计——它是一个持续的过程。
在 573 家企业未加控制就部署 Agent 的行业现状下,一个简洁的评估框架比一千页的合规文档更有用。Anthropic 的四问题框架不会告诉你如何配置每一个技术控制——但它会确保你在部署 Agent 之前,先问对了问题。
因为治理的第一步不是找到答案——是问对问题。
在这个框架发布之前,Agentic AI 的风险评估方法大致分为两类:一类是过于技术化的架构检查清单(如 OWASP 的 10 大 Agentic 风险),另一类是过于抽象的治理原则(如"确保 AI 系统安全")。前者缺乏战略视角,后者缺乏可操作性。
第一个问题也是最基础的问题。不是问"Agent 有什么能力",而是问"我们信任 Agent 做什么"——这是一个权限问题。
第二个问题关注 Agent 的运行上下文。同样的 Agent,在不同的环境中,风险水平完全不同。
第三个问题是最常被忽略的。企业倾向于问"Agent 会正常工作吗",但很少问"如果 Agent 出错,最坏能坏到什么程度"。
第四个问题关注运行时控制和可观测性。无论你在前三个问题上做了多少准备,Agent 仍然可能以你未曾预料的方式行为。
AI 网关只告诉你请求去了哪,JetStream 回答它该不该发
JetStream Clearance 把零信任的信任边界从身份下移到单次动作:AI Blueprints 契约 + 参数级权限 + 序列检测,在 MCP 调用执行前逐动作授权。网关已成商品,授权引擎是下一个战场。
审查过的 MCP 工具在第四次调用开始背叛你:Deadbugz 的运行时门控投毒
Pillar Security 披露活跃 MCP 供应链活动 Deadbugz:恶意服务器伪装成文本格式化工具,前三次调用一切正常,第四次起改写返回的工具元数据,指示 agent 搜寻 SSH 密钥、AWS 凭证并隐藏行为。一次性审查被系统性绕过——工具描述是运行时安全边界,批准应发生在动作执行之时。
比提示注入更隐蔽:Agent 数据注入与 Agentjacking 正在劫持你的 Agent
2026年7月学术披露“Agent 数据注入”(ADI)——不篡改指令,而是污染 Agent 信任的数据,让网页 Agent 点错按钮、编码 Agent 执行陌生命令;Tenet 的 Agentjacking 则用伪造 Sentry 错误报告劫持 Agent。Agent 信任的数据成了新的攻击面。
AI Agent安全信心悖论:82%高管自信,仅14.4%获完整审批
Gravitee对900多位高管与工程师的调研显示:82%高管相信现有策略能防住未授权Agent行为,但仅14.4%的Agent获得完整安全审批上线,88%企业已遭遇或疑似遭遇安全事件。可见性与身份是最大短板。