2026 年 8 月 · 6 分钟阅读

关键定义
AI 保证(AI Assurance) 企业验证一个 Agent 是否始终停留在管理层批准的条件之内。保证从测试开始:Agent 能否触达范围外的信息、调用未批准的工具、在停止条件后继续行动,或把错误假设带入另一个系统。
自主权作为可续期许可(Autonomy as a Renewable License) 把 Agent 的自主权视为需要续期的许可:每当模型、接入数据、可用工具、工作流或权限发生重大变化,就重新验证其边界,并把保证绑定到具体的 Agent 与工作流版本。
运营记录(Operating Record) 四份相连的记录:获批基线、边界测试结果、行为漂移历史、异常与干预记录。它们共同构成可审计的、能支撑董事会讨论、审计或监管回应的证据主体。
企业花了几十年学会审计人和软件。Agentic AI 创造了第三类主体:能解读指令、调用工具、跨工作流自主行动的系统,却还没有围绕它建立成熟的保证模型。结果是管理层承担问责,控制却分散在多个团队之间。这篇文章给出的规则很直接——没有哪个 Agent 应获得超出企业能验证的自主权。
Agentic AI 让一个结果可能流经多个系统:Agent 收集信息、选择工具、产出代码、路由请求,在一个人批准结果之前把工作交给另一个 Agent,而可能没有任何单一管理者观察过完整路径。当运营活动变得更加自主时,行政问责仍然属于人类——CIO 必须能解释是谁授权了这项活动、Agent 是否停留在获批目的之内、以及管理层的回答依据什么证据。
这构成董事会层面的落差:管理层承担责任,控制权却分散在团队、系统与工作流之间。一份保证模型必须提供的远不止一句意图声明。CIO 文章中引用的调查显示,三分之二的 CIO 和 CTO 被要求为无法完全控制的 AI 系统负责,70% 表示技术正以 IT 能追踪的速度更快的速度扩散,77% 认为采用速度超过了治理能力。
软件按预设逻辑运行,人按制度管理;Agent 介于两者之间。它通过软件运行,却会解读指令并选择路径。其行为可能因模型、提示、接入数据、可用工具或周边工作流的变化而改变——一次部署时获批的控制,可能在数月后无任何明显变更就失效。这正是 NIST 关于监控已部署 AI 系统的报告所指出的:漂移、碎片化日志和不成熟的标准,是部署后监督的障碍。
因此,政策、仪表盘和日志只是建立控制。保证从企业测试 Agent 是否停留在管理层批准的条件内开始:部署前文档化业务目的、责任所有者、触达系统、允许动作与停止条件;随后测试 Agent 能否触达范围外的信息、调用未批准的工具、在停止条件后继续行动,或把错误假设带入另一个系统。
对每个具有实质运营权限的 Agent,企业应当建立四份相连的记录:获批基线、边界测试结果、行为漂移历史、异常与干预记录。它们共同给管理层一份能支撑董事会讨论、审计或监管回应的记录,而不依赖技术团队的记忆。运营记录还应在工作发生时产生——一旦 Agent 跨多个系统行动,重建过程可能依赖不同厂商、团队和工具创建的日志,缺失的上下文会把清晰的技术事件变成含糊的管理解释。
获批基线(Approved Baseline)
记录 Agent 的业务目的、责任所有者、触达系统、允许动作与停止条件。这是判断一切后续行为是否越界的基准。
边界测试(Boundary Tests)
测试边界是否真的能挡住:Agent 能否触达范围外信息、调用未批准工具、在停止后继续、或把错误假设带入别的系统。
漂移历史(Drift History)
追踪行为随模型、数据、工具或工作流变化而发生的行为漂移,捕捉“部署时获批、数月后失效”的控制弱化。
异常与干预(Exceptions and Interventions)
记录所有异常、人类干预与未解决发现,作为后续是否扩大 Agent 权限的依据。
规模让这个问题变得更急迫。Gartner 预测到 2026 年底 40% 的企业应用将包含任务型 Agent(2025 年不足 5%),同时 40% 以上的 Agentic AI 项目可能因成本上升、商业价值不清或风险控制不足而在 2027 年底前被取消。IBM 2025 数据泄露成本研究显示,13% 的受访组织报告过涉及 AI 模型或应用的泄露,其中 97% 承认 AI 访问控制不足,63% 缺乏管理 AI 或防止影子 AI 的治理政策。
标准仍在演进。2026 年 2 月,NIST 启动了专注于 Agent 安全操作与互操作性的 AI Agent 标准倡议;世界经济论坛在《AI Agents in Action》中建议让防护措施随 Agent 的自主性、权威与复杂度扩展。CIO 文章还引用 Google DeepMind CEO Demis Hassabis 关于为前沿 AI 建立独立标准机构的提议——其原则同样适用于企业:自主性的扩展,需要对应的独立评估。
在批准更广泛使用之前,管理者应问四个问题:公司授予了什么权威?哪些测试证明边界能守住?数月后仍会留下什么记录?当记录显示失败时,谁承担责任?更广泛的职责应跟随经过测试的边界与干净的异常历史;出现漂移或反复干预,就应暂停扩展,直到弄清原因。审计自主权,本质上是把“可验证的边界”“受监控的变更”与“文档化的干预”作为扩展 Agent 权限的前提——这是 Agent 时代企业要建立的下一项纪律。
保证差距的本质,是问责与控制的错位:管理层签字负责,控制却散落在多个工具与团队里。对很多企业而言,立刻能做的不是建一套复杂的独立评估机构,而是为每一个有实质权限的 Agent 建立那四份记录,并把“自主权只能随保证能力扩展”当作一条硬约束。当运营记录能在工作时自动产生、边界测试能重复运行、漂移能被持续监控,Agent 的权限扩张就有了可辩护的依据——这正是把 Agent 从“试点玩具”推向“可规模化生产系统”的治理地基。
参考来源:CIO, \"The AI assurance gap: CIOs need proof that agentic AI controls actually work\", 2026-08-03, https://www.cio.com/article/4204554/the-ai-assurance-gap-cios-need-proof-that-agentic-ai-controls-actually-work.html
管理层承担 Agent 的问责,但控制权分散在多个团队、系统与工作流之间。CIO 文章给出的规则是:没有哪个 Agent 应获得超出企业能验证的自主权。政策、仪表盘和日志只是建立控制,保证从测试 Agent 是否停留在获批条件内开始。
软件按预设逻辑运行,人按制度管理;Agent 介于两者之间——它通过软件运行,却会解读指令并选择路径。模型、提示、接入数据、工具或工作流任一变化都可能让已获批的控制在数月后失效,而无明显变更。
获批基线(业务目的、责任所有者、触达系统、允许动作、停止条件)、边界测试结果、行为漂移历史、异常与干预记录。这四份记录让管理层能支撑董事会讨论、审计或监管回应,而不依赖技术团队的记忆。
Gartner 预测到 2026 年底 40% 的企业应用将包含任务型 Agent(2025 年不足 5%);IBM 2025 数据泄露成本研究显示 13% 的企业报告过涉及 AI 的泄露,其中 97% 承认 AI 访问控制不足。三分之二的 CIO/CTO 被要求为无法完全控制的 AI 系统负责。
部署前文档化 Agent 的业务目的、责任所有者、触达系统、允许动作与停止条件,并做边界测试;把自主权当作可续期许可,在重大变更后重新验证;对每个具有实质运营权限的 Agent 建立四份相连记录;让自主权只随保证能力扩展。
被“卡住”的自动化:企业 Agentic AI 为何大面积停滞
IDC/Gartner/McKinsey 数据指向同一结论:88% 的 AI 试点未能进入生产、仅 28% 项目实现回报。企业 Agentic AI 呈“少数高产、多数停滞”两极分布,真正瓶颈是数据基础与上下文碎片化,而非模型能力。
Agentic AI成熟度差距:领先者正在拿走大部分价值
Box对1640位IT决策者的2026调研:领先企业以不同方式运营Agent——整合进多步骤工作流、接入企业知识、正式化治理。45%采用混合Token经济模型(早期28%升至领先50%),仅18%把成功归功于中央AI团队。
Agent交互成本从$0.04暴涨至$1.20:企业AI Agent真实成本危机
EY数据显示Agent客服交互成本从2023年的$0.04飙升至2026年的$1.20。一个中等复杂度的Agent三年TCO达€368K,是朴素估算的2.3倍。成本失控正在成为Agent规模化部署的头号障碍。
AI Agent保险正在收紧:2026年除外责任与承保新逻辑
ISO发布生成式AI除外责任条款,网络保险承保人将AI Agent视为'特权执行层'。企业续保前必须补齐治理证据。