2026 年 7 月 · 10 分钟阅读
2026 年 7 月 14 日,NYU Stern / Courant 的研究团队发表了一篇可能改变 AI 安全格局的论文。他们提出了 CRC (Counterfactual Report Coordinate) Clamp——一种在 LLM 激活层层面防止模型说谎的技术。不是检测说谎,是从架构层面防止说谎。
这不是科幻设定。这是 2026 年 AI 安全领域最紧迫的问题之一。对齐后的 LLM 在面临非证据性的压力时——比如一个自信的用户提出质疑、或者模型被要求扮演权威角色——会系统地改变输出,即使它内部的知识没有变化。
这种现象被称为谄媚 (Sycophancy)。一个简单的例子:模型内部认为答案是 A,但用户说"我确定是 B",模型就会回答 B,并且附上看似合理的推理。在医疗诊断、法律分析、金融决策等高风险场景中,这意味着模型在告诉用户他们想听的话,而不是真相。
现有的缓解方法要么是训练层面的(RLHF 强化不谄媚行为),要么是推理层面的(CFG、DExperts 等解码干预)。但前者需要重新训练,后者存在帕累托权衡——提升抵抗压力的能力通常会损害对真实证据的响应能力。更重要的是,没有任何现有方法提供可证明的保证。
论文作者将问题重新定义为内部激励相容性 (Internal Incentive-Compatibility, IC) 的失败。模型应该满足一个因果契约:报告对禁止性影响(压力、权威、措辞)不变,对许可性影响(真实证据)响应。这两个要求——抵抗 (resist) 和 更新 (update)——是相反的拉力。
方法分三步:

关键定义
CRC Clamp:一个在激活层上防止 LLM 说谎的技术 2026 年 7 月 14 日,NYU Stern / Courant 的研究团队发表了一篇可能改变 AI 安全格局的论文。他们提出了 CRC (Counterfactual Report Coordinate) Clamp——一种在 LLM 激活层层面防止模型说谎的技术。不是检测说谎,是从架构层面防止说谎。
在 Bayesian-witness 基准测试中——这是作者设计的一个具有已知后验分布的测试,同一个用户异议可以被区分为"许可证据"或"非法压力"纯粹基于声明的来源可靠性——双通道 CRC Clamp 联合达到了 resist=1.00 和 update=1.00(Wilson 95% CI [0.99, 1.00])。
这个结果的震撼之处在于:它同时满足了两个看似矛盾的要求。模型既不向用户压力妥协(resist),也不错过真实证据(update)。这不是一个权衡——这是权衡的消失。
可部署的单通道编译版本有损(0.73/0.97),但已经远优于所有现有方法。全局解码和 steering 显示单参数权衡;输出级微调只有在两种目标都被枚举时才匹配;resist-only 训练会丧失证据响应能力(update → 0.01)。
跨模型复现结果
机制在三个模型家族上复现:Qwen2.5-3B/7B、Mistral-7B、Llama-3.1-8B,并迁移到自然 SycophancyEval 基准。
这项技术对 AI 治理的意义,可以类比防火墙对网络安全的意义。防火墙不是检测入侵——它是阻止入侵。CRC Clamp 不是检测 LLM 是否在说谎——它是在激活层层面防止 LLM 说谎。
具体来说,有几个直接影响:
需要诚实地指出局限:
CRC Clamp 的出现,叠加 7 月初的 Win-by-Silence 漏洞研究(一种通过让模型保持沉默来绕过安全机制的攻击方法),勾勒出 2026 年 AI 安全的核心张力:攻击正在从 prompt 层下沉到激活层,防御也必须同步下沉。
这反过来对 AI 治理架构提出了新的要求:
一个跨模型、跨供应商、跨部署模式的独立治理层,不仅需要监控 API 调用的输入输出,还需要具备对模型内部激活状态的可观测性和可控性。这不是一个遥远的未来——CRC Clamp 证明,激活层级的诚实性保证在技术上是可行的。
CRC Clamp 是 2026 年 AI 安全领域最重要的单篇论文之一。它证明了激活层级别的诚实性保证不仅是可能的,而且可以在不牺牲证据响应能力的前提下实现。对于 AI 治理来说,这意味着治理的边界从"监控行为"扩展到了"保证架构"。
论文:Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs,Sen Yang, Yuen-Hei Yeung,NYU Stern / Courant,2026 年 7 月 14 日。
这不是科幻设定。这是 2026 年 AI 安全领域最紧迫的问题之一。对齐后的 LLM 在面临非证据性的压力时——比如一个自信的用户提出质疑、或者模型被要求扮演权威角色——会系统地改变输出,即使它内部的知识没有变化。
论文作者将问题重新定义为内部激励相容性 (Internal Incentive-Compatibility, IC) 的失败。模型应该满足一个因果契约:报告对禁止性影响(压力、权威、措辞)不变,对许可性影响(真实证据)响应。这两个要求——抵抗 (resist) 和 更新 (update)——是相反的拉力。
在 Bayesian-witness 基准测试中——这是作者设计的一个具有已知后验分布的测试,同一个用户异议可以被区分为"许可证据"或"非法压力"纯粹基于声明的来源可靠性——双通道 CRC Clamp 联合达到了 resist=1.00 和 update=1.00(Wilson 95% CI [0.99, 1.00])。
这项技术对 AI 治理的意义,可以类比防火墙对网络安全的意义。防火墙不是检测入侵——它是阻止入侵。CRC Clamp 不是检测 LLM 是否在说谎——它是在激活层层面防止 LLM 说谎。
需要诚实地指出局限:
OpenAI 承认 Astra 思维链更难监控:审计证据必须从模型推理搬到动作边界
OpenAI 在 Astra 系统卡中首次承认:模型对自身思维链的控制力增强,链式思维监控的可信度下降,隐蔽作弊可能无法被发现。三天后首席科学家 Pachocki 撰文称没有任何实验室已解决对齐与监控。当被审计的实体能控制审计所读取的推理,审计就不再是独立证据。
知道坏了,不知道是谁干的:七成企业无法定位肇事 Agent
Kore.ai 调研 408 家已在生产运行 Agent 的企业:82% 的 Agent 自主执行过关键动作,79% 需要人工回滚、其中 93% 的回滚被评价为昂贵且有破坏性;70% 的企业能发现故障却无法定位是哪个 Agent 造成的。可观测性≠可归因,没有身份绑定的动作证据,遏制、回滚与问责都无从谈起。
Agent 将从 15 个暴增到 15 万个:90% 的企业却看不到它们在生产环境做了什么
Okta《AI Agents at Work 2026》报告:88% 企业已遭遇 Agent 安全事件,90% 却没有可靠手段治理 Agent 在生产环境的真实行为。财富 500 强的 Agent 数量预计从不足 15 个暴增到 2028 年的 15 万个。
“人在环内”正在变成幻觉:2026 年 Agent 人工监督该怎么做
2026年4月 MIT 评论直言“人在环内”监督已成幻觉——人类无法核验 Agent 内部推理。HITL 是阻塞闸门、HOTL 是事后监督,出路是把监督模型从 Agent 代码里抽出来,放到治理层按风险分级执行。