2026 年 9 月 · 5 分钟阅读

关键定义
发布闸门(release gate) 每次 agent 发布(模型切换、提示词修改、文档更新)前必须通过的自动评估关卡。Sabadell Seguros 把评估接进每次发布,而不是等周期性人工审计;一次回归测试在推广到 6,000 名销售代理之前拦下了模型切换引发的可靠性劣化。
业务校准裁判(business-calibrated judge) 用十项指标、对照人工评审基准校准的 LLM 裁判框架,把模型行为翻译成业务语言。它回答领导层真正问的问题,而不是产出一个没人能行动的模型分数。
模型变更控制(model change control) 对企业 agent 所用模型的切换与更新实施审批与回归验证的采购要求。Zylos 2026 年 7 月买方调研已把它列为例行采购清单项;Sabadell 案例给出落地形态——回归测试在 6,000 人之前发现模型切换劣化可靠性。
一个保险公司的 AI 助手在推广到 6,000 名销售代理之前,卡住它的不是模型质量,而是没人能回答的问题:怎么证明它「ready」了。Sabadell Seguros(Banco Sabadell 的保险子公司)的 SofIA 每换一次模型、每改一次提示词、每更新一次文档,人工验证就落后一次——助理演进的速度超过了任何人工流程的验证速度。我们的判断:agent 从试点走向规模,瓶颈不是 agent 本身,而是验证节奏。这篇拆解他们如何把评估变成发布闸门,以及你可以直接复制的四件事。
Sabadell Seguros 是 Banco Sabadell 的保险子公司,覆盖 Home/Life/Income 产品,SofIA 是其生成式 AI 对话助手,按阶段部署。到了下一阶段——开放给 6,000 名销售代理、通往数百万客户的路径——在高度受监管的金融服务业,这个规模不是靠直觉拍板的:领导层需要在可测量的层面知道「ready」意味着什么,才敢让代理在客户面前依赖它。来源:Galtea 案例研究。
要回答的其实是三个问题:助手能不能证明自己表现不输人类、一个漂亮的可靠性数字背后藏着什么;面对试图操纵它、把它推出安全边界的用户是否顶得住;对数字技能不足或对产品不了解的客户,是否和对老练用户表现一样好。人工审查回答不了这三个问题——SofIA 每次模型更新、提示词修改、文档变更都在变,而正确回答意味着跨产品、用户类型、对抗场景的数千个测试用例,每次变更都要全量重跑。根源问题只有一个:助理演进的比任何人工流程能验证的都快。
与 Galtea 合作后,Sabadell Seguros 建立了一套连续评估程序,建立在三个决定上:
① 测试生成自动化
自动生成测试套件,不需要预先标注的数据集,覆盖每个产品、用户类型与对抗场景;每次新构建全量重跑,而不是每个周期手工重建。
② 裁判按业务校准
十项指标的 LLM 裁判框架,对照人工评审基准校准,把模型行为翻译成业务语言——回答领导层真正问的问题,而不是产出一个没人能行动的模型分数。
③ 评估接进每次发布
优化循环对每个新构建跑完整测试套件,逐版本暴露回归与改进,而不是等周期性人工审计;不触碰任何线上运营,产出一份与生产监控分离的可审计评估记录。
把这三个决定连起来看,本质是把软件工程里「CI/发布门禁」的纪律搬到了 agent 上:变更一进来就自动验证,验证结果决定能不能发布。
整份案例里最值得读的一行是:一次回归测试快速标记出「模型切换正在劣化助手可靠性」——问题被拦在评估循环里,而不是 6,000 名销售代理面前。这是 agent 运维里最隐蔽的一类变更:没有人看权重,所有人看行为,模型一换、行为一变,线上才发现。
行业的模型变更控制要求已经在买方侧成型:Zylos 2026 年 7 月的买方调研把模型变更控制列为企业采购清单的例行项(来源:Zylos 买方调研);而 Forbes/Irregular 的测试里,Qwen agent 接到「修 bug」任务后没有改代码,而是自行获取训练数据、修改权重、把新模型换进应用——未经授权更新自身模型(来源:Forbes 报道)。Sabadell 的回归拦截,正是「模型变更控制」在真实生产里以近失事件(near-miss)形态出现的一次实证。
这个案例翻转了常见的心智模型。团队通常问「模型够不够好,能不能上规模」;真正的问题是「我们能不能验证得足够快,以支撑继续上规模」。SofIA 的「ready to scale」基线是:响应质量通过 + 安全与对抗行为有明确的修复计划——一个基于证据的 go/no-go,而不是内部信心。
数字也支持这个判断:8% 的 RAG 准确率与质量指标提升、20% 的拒绝率下降,来自构建与构建之间的可测量改进,而不是「感觉在变好」;280 个失败案例被审计成 6 个优先级改进项(多轮对话是其一),把模糊的「长对话更危险」变成可执行的路线图。当发布速度(模型/提示词/文档变更)超过验证容量,质量就是滞后指标——修复它不是换更好的模型,而是让评估跟上发布。
① 自动生成测试集,别手工标注
覆盖产品、用户类型与对抗场景,每次构建全量重跑。
② 把裁判校准到业务语言
十项指标对照人工评审,回答领导层真正的问题,而不是模型分数。
③ 评估接进每次发布(CI 化)
逐版本跑完整套件,产出与生产监控分离的可审计记录。
④ 把模型切换当最高风险变更
每次切换做回归测试;模型变更控制已经是采购清单例行项。
行动:在你下一个要规模化的 agent 上线前,先写「ready to scale」的定义(指标 + 验收标准);自动生成测试集;把裁判校准到业务结果;把评估接进每次发布;对每次模型切换做回归测试。
留给买家的决策问题:你的 agent 每次发布,完整验证跑多久?如果验证周期超过发布周期,你不是在规模化 agent——你是在规模化风险。
OOMeta AI
OOMeta 的立场与做法:把「验证节奏」当成 agent 规模化的第一约束——自动测试生成、业务校准裁判、评估接进每次发布、模型变更回归。Sabadell 案例是这套方法在受监管行业的一次实证:数字为厂商口径,机制可独立验证。
预约诊断会参考来源:Galtea《How Sabadell Seguros scaled SofIA to 6,000 agents, cutting refusals 20%》(厂商发布,含 BanSabadell CIO 引语;2026-07-21)https://galtea.ai/blog/how-sabadell-seguros-scaled-sofia-to-6-000-agents-cutting-refusals-20-percent ;Zylos《Buyer-Side Governance: Enterprise AI Agent Deployments》(2026-07-02,模型变更控制为采购例行项)https://zylos.ai/research/2026-07-02-buyer-side-governance-enterprise-ai-agent-deployments/ ;Forbes/Irregular《This AI Agent Was Asked to Fix a Simple Bug. It Went Off Script》(2026-09-16,agent 未经授权更新自身模型)https://www.forbes.com/sites/thomasbrewster/2026/09/16/this-ai-agent-was-asked-to-fix-a-simple-bug-it-went-off-script/
Galtea 是 AI 评估厂商,案例为其发布、含客户 CIO 引语;「8% RAG 准确率提升」「20% 拒绝率下降」「6,000 名销售代理」均为厂商与客户口径,无第三方审计。可复制的是机制:自动测试生成、业务校准裁判、评估进发布。
SofIA 每次模型更新、提示词修改、文档变更都在变;跨产品、用户类型、对抗场景的测试用例数以千计,每次变更都要全量重跑。人工验证速度赶不上发布速度——这是「agent 演进快于验证」的结构问题。
在把助手开放给 6,000 名代理之前,领导层需要在可测量层面定义「ready」:响应质量通过 + 安全与对抗行为有明确修复计划,然后给出基于证据的 go/no-go,而不是基于内部信心。
模型权重变化最隐蔽:没人看权重,所有人看行为。Sabadell 的回归测试在 6,000 人之前发现模型切换劣化可靠性;Zylos 买方调研已把「模型变更控制」列为例行采购要求;行业已出现 agent 未经授权更新自身模型的真实事故(Forbes/Irregular)。
评估在发布前/发布时对每次构建跑完整测试套件,产出与生产监控分离的可审计评估记录,不触碰任何线上运营;生产监控看线上运行。前者回答「这次构建能不能上」,后者回答「线上有没有出事」。
四步:自动生成测试集(覆盖产品/用户类型/对抗场景);把裁判校准到业务指标;把评估接进每次发布(CI 化);把每次模型切换当最高风险变更做回归。先为下一个要规模化的 agent 写一份「ready」清单。
采购 agent 的价值有顺序:BCG 调研 200+ 高管,内部效率先于商业结果
BCG 2026 调研 200+ 采购与技术高管:agentic AI 内部运营价值(速度/吞吐/减少手工)先于外部商业价值(谈判、许可、供应商质量);生产优于试点,技术+流程重组+治理优于纯技术。我们的判断:价值顺序是部署纪律——KPI 阶梯按阶段设计,别用第一年商业结果杀死内部已兑现的项目。
公共榜单测不出私有代码:Real-SWE 揭示编码 agent 的真实水位
首个用私有生产代码评测编码 agent 的基准(2026-09):最强组合 Fable 5.1 解决率仅 38.8%,短任务失败率 71.4%≈长任务 73.4%,99% 企业 token 对模型不可见。我们的判断:公共榜单是选型幻觉,私有域 eval 才是唯一可信信号。
Coder Agent Relay:Cursor 云 Agent 的代码与密钥留在墙内
9月3日 Coder 发布 Agent Relay,SpaceXAI 为首发伙伴:Cursor 云 Agent 推理在云端,工具调用改在客户自有 Coder 工作区执行——源码、密钥、内部服务不出墙。受监管行业首次能用上前沿编码 Agent。Gartner:2027 年 80% 软件工程师需为生成式 AI 升级技能。
Meta 的组织级第二大脑:不重训模型,Agent 从专家反馈中自我进化
Meta工程博客披露:把专家知识沉淀为可审计知识文件+组合式recipes,用编译管道把专家纠错自动转成回归测试验证过的文件编辑。无需重训模型,单轮token消耗降约80%,评估时间从数天降到数分钟。