2026 年 9 月 · 7 分钟阅读

关键定义
双循环(Dual Loop) 开发循环与生产循环由质量门禁连接:开发循环里设计、迭代、评估 agent 版本;生产循环里监控线上行为、检测失败;失败自动回馈开发循环。任何改动必须先在金标数据集上通过质量门禁,才被允许进入生产。
金标数据集(Golden Dataset) 评估 agent 行为的事实标准:覆盖正常、边界与失败场景,带业务标注。Zepto 用六个月把它从 500 条做到 5,247 条,dev-prod 精度差从 8 个点收敛到 0.4 个点。数据集质量是 10 倍杠杆:每小时投入省约十小时生产调试。
分层采样(Stratified Sampling) 评估采样率不按均匀百分比,而是按风险分层加权:高价值客户、新功能、负面情绪、欺诈风险等场景采得更密。Zepto 用 18–20% 的有效采样率捕获 45–60% 的边缘案例,比均匀采样省 86% 的每条问题复核成本。
大多数团队把「评估」当成上线前的最后一道检查:模型选好了、prompt 调好了,跑一轮 eval 确认没坏,然后上线,eval 束之高阁。Zepto 把这套顺序倒了过来——评估是 agent 被构建、测试、运营的主要方式。结果是 80%+ 工单被 AI 全流程处理、客服成本降 65%、回本不到一个月。评估优先不是质量洁癖,它恰恰是这一代客服 agent 里最直接的省钱杠杆。
Zepto 是印度快速电商平台,覆盖 60+ 城市,配送以分钟计,客服每天处理超 10 万张 AI 工单。在 Databricks 与 MLflow 上做评估基座后,Zepto 报告:80%+ 工单由 AI agent 在人工监督下全流程处理;客服成本或客服工单量降 65%;回本周期不到一个月;CSAT 提升 20%、准确率提升 8%;开发周期快 3 倍、解决时间快 4 倍(来源:Databricks 官方博客案例,厂商与客户联合口径 — https://www.databricks.com/blog/evaluation-first-ai-agents-how-zepto-scales-customer-support-databricks-and-mlflow )。数字是自报的,但「回本不到一个月」这个位置很说明问题:当评估被当成基础设施,成本控制就不是事后看账单,而是写进开发循环本身。
为什么「just ship the agent」在规模上会崩?因为 agentic 系统是多步工作流——意图分类、知识检索、推理、调用交易工具、生成回复——失败可能出现在任何一步,不只是最终答案。10 万张工单/天,1% 的错误率就是每天上千个坏结果、真实的收入漏损。这个「保证缺口」(assurance gap)正是 eval 基础设施要填的东西。
框架的核心是双循环:开发循环(设计、迭代、评估 agent 版本)+ 生产循环(监控线上行为、检测失败),中间由质量门禁控制。任何对 agent 逻辑、prompt 或模型的改动都会自动触发回归评估:新版本要同时满足两件事——在所有 pillars 上达标(客户体验、运营效率、风险合规、财务影响各有数值阈值),并且不劣于当前生产基线。达标才晋升生产,不达标打回开发循环。生产里的每个失败都自动回馈开发循环,变成下一轮的训练料。
这个结构把「上线」从事件变成过程:agent 永远在开发与生产之间流动,门禁是唯一的闸口。Zepto 因此能把「这个版本感觉更好」的 gut-feel 决策,替换成「这个版本在约定指标上胜过基线」的证据决策。
金标数据集是整个框架的事实标准:覆盖正常、边界、失败场景,各利益方(含安全团队喂的对抗样本)共同塑造。Zepto 用六个月把它从 500 条做到 2,000 条再到 5,247 条,同时 dev-prod 精度差从 8 个点收敛到 2 个点再到 0.4 个点。他们给出的经验法则是:花在数据集质量上的每小时,省约十小时生产调试——金标数据集是 10 倍乘数,每个生产失败都会把失败 trace 加进数据集,让系统对未来的版本更稳。
这里有一个反直觉的判断值得买方记下:dev-prod 精度差不是「生产环境太复杂」的托词,它是数据集质量信号。差距大,说明开发数据集没覆盖生产会遇到的场景——该补的是数据,不是更强的模型。把差距当作可管理的读数,而不是玄学,这正是评估基础设施化之后才看得见的东西。
评估 100% 流量太贵,但朴素地均匀抽 10% 会漏掉大多数边缘案例。Zepto 的做法是按风险分层加权采样:高价值客户、新功能或刚改过的流程、负面情绪、高升级风险、图像与欺诈类交互采得更密。结果是用 18–20% 的有效采样率(约 1.44 万条 trace/天)捕获 45–60% 的边缘案例,4–6 分钟内发现问题(来源:同上 Databricks 博客 — https://www.databricks.com/blog/evaluation-first-ai-agents-how-zepto-scales-customer-support-databricks-and-mlflow )。
这笔账是这一整套方法里最「成本」的一段:相比均匀采样,分层方法论把每条被识别问题的复核成本降了 86%,边缘案例检出提升 9 倍。它同时反驳了一个常见的工程借口——「评估太贵所以只做 10%」。贵的是盲目采样,不是评估本身;把采样率押在风险最高的流量上,评估就从成本项变成成本杠杆。
第一,评估优先不是质量洁癖,是成本杠杆——eval 基础设施化之后,成本控制(模型选型、prompt 优化、采样)都写进开发循环,回本周期才能压到一个月以内。第二,dev-prod 精度差是数据集质量信号,不是玄学——差距大就补数据,补到收敛为止;这是把评估当资产、给它 KPI(规模、dev-prod 差、边缘覆盖)的直接后果。第三,采样策略比采样率重要——把评估预算押在风险最高的流量上,成本降 86%、检出升 9 倍;均匀采样的「便宜」是假便宜。第四,这与 OOMeta 自己的开发纪律同构:我们的 spec-driven 工程循环跑双评估(生成器 + 评估器),并且显式地验证 eval 分数是真实差距而不是表面达标——不把「看起来过了」当成「过了」。
第一,从 trace 而不是从模型开始:强制共享 trace schema,把所有 agent 调用落库——没有 trace,评估、金标数据集、门禁全都无从谈起。第二,把评估设成 CI/CD 的强制门禁:不比基线好就不部署,让「上线」变成证据决策而不是感觉决策。第三,把金标数据集当资产运营:给它自己的 KPI(规模、dev-prod 差、边缘覆盖),每月看差距是否收敛。第四,上线前就把分层采样与实时告警做好:事后补运营可见性是最贵的路线。第五,绝不优化单一指标:Zepto 单独追意图精度时,+5 点意图换来了 +133% 延迟和 −0.4 点 CSAT;复合多目标评分才是对的方向。
留给你的决策问题:如果你把「dev-prod 精度差」写进团队每个月的运营报告,并强制它持续收敛——你现在有多少 agent 经得起这个数?
OOMeta AI
OOMeta 的工程循环把双评估、eval 门禁与「验证 eval 分数是真实差距」写进日常开发纪律。我们帮企业把 agent 开发从「上线前检查」改造成「评估即基础设施」——从 trace 到金标数据集到分层采样的一整条流水线。
预约诊断会参考来源:①Databricks 官方博客案例「Evaluation-First AI Agents: How Zepto Scales Customer Support」(厂商与客户联合口径,2026-09-09)— https://www.databricks.com/blog/evaluation-first-ai-agents-how-zepto-scales-customer-support-databricks-and-mlflow
超过 10 万张 AI 工单/天。Zepto 是印度快速电商平台,覆盖 60+ 城市,配送以分钟计——客服速度本身就是产品。结果(Databricks 案例口径):80%+ 工单由 AI agent 在人工监督下全流程处理,客服成本降 65%,回本不到一个月。
没有。案例发布在 Databricks 官方博客,属于厂商与客户联合发布的案例研究,数字为自报口径。可迁移的不是百分比,而是方法:双循环、质量门禁、金标数据集、分层采样——这些模式不依赖任何特定厂商栈。
开发循环(设计、迭代、评估新版本)与生产循环(监控线上、检测失败)通过质量门禁连接。任何改动触发自动回归:新版本必须在金标数据集上不劣于生产基线,否则打回开发循环。失败自动回馈,生产崩溃不断充实金标数据集。
因为开发与生产之间的精度差距,主要来自开发数据集没覆盖生产会遇到的场景。Zepto 用六个月把数据集从 500 条做到 5,247 条,dev-prod 差从 8 个点收敛到 0.4 个点——差距本身就是「数据集还缺哪些场景」的读数,而不是玄学。
均匀采样 10% 会漏掉大多数边缘案例;分层采样把采样率按风险加权,用 18–20% 的有效采样率(约 1.44 万条 trace/天)捕获 45–60% 的边缘案例、4–6 分钟内发现问题。对比均匀采样,每条被发现问题的复核成本降 86%,边缘案例检出提升 9 倍。
先建 trace 与金标数据集,再谈评估:强制共享 trace schema、把所有调用落库;把 MLflow 类评估设成 CI/CD 的强制门禁——不比基线好就不部署。golden dataset 是资产,要给它自己的 KPI(规模、dev-prod 差、边缘覆盖)。
1100 人公司跑起 50+ agent:ROI 是测量纪律,不是案例
ABC Legal 用 Claude Managed Agents 把 50+ agent 推上生产。可迁移的是方法——建议先给人审→标注数据→eval 门槛→自动化,每个 agent 按效率比单独记账。
企业 AI 规模化的 ROI 缺口:试点之后,钱去了哪
试点阶段的 ROI 与规模化后的 ROI 之间存在系统性缺口。我们的判断:缺口不在模型,在部署模式与测量方式。
AI Agent 的 ROI 基准:当试点测量变成生产测量
用数据回答 agent ROI 的测量问题:什么该测、怎么测、谁为结果负责。
供应链 Agent 的生死不在模型:Kenco 三个月上线的测量纪律
Gartner 预测 2027 年前超 40% 的 agentic AI 项目被取消。我们的判断:试点与生产之间的鸿沟是测量问题——先定基线、按 Agent 定 KPI、部署后再测。