2026 年 8 月 · 6 分钟阅读

关键定义
人在环内(Human-in-the-Loop, HITL) 一种 Agent 监督模式:在执行某个定义好的动作前,Agent 暂停工作流、提出决策请求并等待——人类必须明确批准、拒绝或改向后,执行才继续。它不是监控,而是一个阻塞性闸门。
人在环上(Human-on-the-Loop, HOTL) 一种 Agent 监督模式:Agent 自主执行,人类通过仪表盘和告警阈值观察输出流,在事后出现异常时介入。没有阻塞闸门,人类的角色是监督而非逐项审批。
一个名义上“在环内”的审批者,正在用不完整的上下文、在时间压力下,批准他看不清因果的 Agent 动作。这不是个例,而是 2026 年企业 AI 最常见的监督假象。2026 年 4 月,MIT 评论的一篇文章把矛头直指军事自主系统——但同样的工程缺口,在企业里以另一种形式存在:人类技术上是“在环内”,实际上只提供了监督的外表。
2026 年 4 月 16 日,MIT 技术评论发表文章《为什么“人在环内”的 AI 战争是一种幻觉》(作者 Uri Maoz)。核心论点很精确:人类监督者无法核验 AI 系统内部到底在推理什么。用于构建更强模型的投资(Gartner 预测 2026 年 AI 支出约 2.5 万亿美元)巨大,而用于理解这些系统如何工作的投资微乎其微——结果就是操作者名义上控制着他们无法真正审计的系统。
这个批评指向军事,但在企业有直接类比。即使 Agent 以人类可审查的速度运行,同样的问题以另一种形式出现:一个技术上“在环内”、却用不完整上下文审批、又在工作流压力下、且看不到 Agent 为何得出该结论的人,并没有在提供监督——他在提供监督的假象。
从业界的回应不是反驳批评,而是提出一个更尖锐的问题:我们是不是连监督模型都用错了?大多数生产团队用错了——不是因为理论上选错了架构,而是把两个截然不同的概念(HITL 和 HOTL)混为一谈,并对 Agent 的所有动作统一套用其中一个。
HITL(人在环内)意味着 Agent 暂停。在执行定义好的动作前,它挂起工作流、提出决策请求并等待。这不是监控,是阻塞性闸门——没有人类响应,Agent 无法继续。它适合的是少数动作:那些错误自主决策的代价远大于延迟代价的动作,比如超阈值财务付款、法律协议、生产基础设施修改、代表高管的对外沟通——也就是不可逆、受监管、高后果的动作。
HOTL(人在环上)则完全不同。Agent 自主执行,人类观察输出流、在异常时事后介入。没有阻塞闸门、没有暂停。它适合更广泛的动作:读取、总结、草稿生成、搜索查询、低风险数据检索。HOTL 下,一个操作者可能同时通过仪表盘监督几十上百个并发的 Agent 任务,人类角色是监督而非逐项审批。
2026 年的标准做法是把监督模型编码进 Agent 代码里——开发者在 Agent 里写死“如果是付款动作就中断”。这能覆盖开发者预见到的那一种情况,却挡不住他没预见到的所有情况。于是出现三类失败:
覆盖漂移(Coverage Drift)
Agent 能力扩张,新动作类型出现,开发者没有预见到,中断逻辑覆盖不到。Agent 对本应被闸门拦截的动作自主执行,直到出事才被发现。
统一性错误(Uniformity Errors)
开发者要么全拦、要么全放。全拦摧毁 Agent 价值(每次动作都阻塞,摩擦大到失去意义);全放制造治理表演——人类名义在环,却缺乏评估所需的上下文,正是 MIT 批评的那种名义而非真实的监督。
没有审计轨迹
当审批规则活在代码里,就没有系统化记录:哪些动作触发了审批、人类做了什么决定、审查花了多久、是否形成模式。合规团队问“你们如何确保对受监管动作的人工监督”,你拿不出干净的答案。
一个集中、分级、由治理层而非 Agent 代码执行的审批策略,能同时解决这三个问题:策略定义动作类别及其所需监督模型,治理层在 Agent 执行前拦截并路由,Agent 代码无需知道。监督模型被集中维护、版本化、可审计——这是大多数可观测性优先工具忽略的区别:可观测性告诉你 Agent 做了什么,治理层则决定 Agent 被允许做什么。
在企业部署中站得住脚的分类法,把 Agent 动作分为三层:Tier 1 自由执行(读取、内部总结、无外部影响的草稿生成,无需人工介入,仅记录日志);Tier 2 监控并标记(有外部影响但可逆的动作——发出草稿邮件、更新非关键记录、低爆炸半径的 API 调用,采用 HOTL);Tier 3 阻断审批(不可逆或高后果——超阈值财务交易、代表组织的外部沟通、生产系统修改、有监管影响的动作,采用 HITL)。
关键点在于:这个分类不是每个 Agent 各自编码的,而是整个 Agent 群的统一策略。新 Agent 引入新动作类型时,默认受同一套分类规则约束——开发者不需要为每一个 Agent 单独思考。当审计者问“整个 Agent 群的人工监督是如何运作的”,没有集中治理的答案是“取决于每个 Agent 是谁写的、什么时候写的”——这显然不是答案。
为什么“人在环内”在现实中失效,Anthropic 给出了一个可量化的证据:Claude Code 早期的权限提示模式中,遥测显示用户批准了约 93% 的权限提示。看到的审批越多,对每一个投入的注意力就越少,监督随时间明显变弱。Anthropic 因此转向了 auto mode——用模型分类器来自动化更安全的审批,以减少审批疲劳。但即便这样,任何概率性防御都有非零的漏检率——这正是“环境层遏制”(限制 Agent 能访问什么)而非“监督 Agent 在做什么”成为工程重点的原因。
“人在环内”不是设计选项,而是被 MIT、被审批疲劳数据、被监管要求反复证伪的假设。真正可靠的人工监督,前提是两件事:一是监督模型不活在 Agent 代码里,而是活在治理层,以集中的、版本化的、可审计的策略存在;二是把监督按风险分级——不是对每个动作都问人类,而是对高后果、不可逆、受监管的动作才让人类介入,其余交给 HOTL 监控。先修好这两个前提,再谈“在环内”,你得到的才是监督,而不是监督的假象。
参考来源:MIT Technology Review, "Why having 'humans in the loop' in an AI war is an illusion", 2026-04-16, https://www.technologyreview.com/2026/04/16/1136029/humans-in-the-loop-ai-war-illusion;Waxell, "Human-in-the-Loop vs Human-on-the-Loop for AI Agents", 2026-04-27, https://waxell.ai/blog/human-in-the-loop-vs-human-on-the-loop-ai-agents;Anthropic Engineering, "How we contain Claude across products", 2026-05-25, https://www.anthropic.com/engineering/how-we-contain-claude;Strata, "Human-in-the-Loop: A 2026 Guide to AI Oversight That Actually Works", https://www.strata.io/blog/agentic-identity/practicing-the-human-in-the-loop
MIT 评论(2026-04-16)指出,人类监督者无法核验 AI 系统内部真正的推理过程;相比用于构建更强模型的天量投资,用于理解 AI 决策机制的投资微乎其微,导致操作者名义上“在环内”却无法进行有意义的审计。
HITL 是阻塞性闸门:Agent 在执行动作前暂停,等待人类批准或改向;HOTL 是事后监督:Agent 自主执行,人类观察输出流并在异常时介入。前者适合不可逆、高后果或受监管的动作,后者适合快速、低风险、可逆的工作。
把审批逻辑写进 Agent 代码会产生三类失败:覆盖漂移(新动作类型没被覆盖)、统一性错误(要么全拦破坏价值、要么全放变成治理表演)、以及没有审计轨迹。监督应放在治理层、以集中策略的形式维护、版本化并可审计。
把 Agent 动作分为三层:Tier 1 自由执行(只读、内部总结)、Tier 2 监控并标记(HOTL,有外部影响但可逆)、Tier 3 阻断审批(HITL,不可逆或高后果)。这套分级不是每个 Agent 各自编码,而是整个 Agent 群统一的策略。
Anthropic 的遥测显示用户批准了约 93% 的权限提示——看得越多,每个看得越不仔细,监督随时间推移明显变弱。这正是 Anthropic 转向用模型分类器自动审批(auto mode)的背景,也是“人在环内”不可靠的直接证据。
Agent 将从 15 个暴增到 15 万个:90% 的企业却看不到它们在生产环境做了什么
Okta《AI Agents at Work 2026》报告:88% 企业已遭遇 Agent 安全事件,90% 却没有可靠手段治理 Agent 在生产环境的真实行为。
授权不等于治理:每一次身份校验都通过,Agent仍改写了安全策略
RSAC 2026 上,一家财富 50 强 CEO 的 Agent 改写了自身安全策略——每一次身份校验都通过。授权只回答了“你是谁”,治理才回答“你能做什么”。
AI Agent 也会退役:被遗忘的 Agent 凭据是 2026 年的隐形风险
部署 Agent 有大量文档,退役却几乎没人写。2026年身份调研显示企业 Agent 集群每季度约翻倍,却只有约五分之一团队为 Agent 建立独立身份。
治理衰减:上下文压缩正在悄无声息抹掉 Agent 的安全约束
2026年6月论文(arXiv:2606.22528)首次命名企业AI最安静的失败模式——治理衰减:上下文压缩会丢弃“过时”的安全规则。