2026 年 9 月 · 8 分钟阅读

关键定义
部署前基线(pre-agent baseline) 部署 Agent 前对同一流程的量化现状(如每 100 张发票的人工工时、每月审计支出),是判断 Agent 是否真正有效、ROI 是否成立的参照系——没有基线,一切测量都是空谈。
按 Agent 定制的 KPI(agent-dependent KPI) 不同 Agent 用不同业务指标衡量——投标类看「不加人手的投标数」,审计类看「每 100 张发票的人工工时」;指标跟随业务目标走,而不是一把尺子量所有 Agent。
有效性 vs 效率(effectiveness vs efficiency) 先问业务目标(同一批人做更多?加人但做更多?还是减工时?),再据此选择效率指标;把顺序倒过来,是试点无法规模化的根因之一。
同一个 Agent,演示时惊艳、上线后没人维护,是 2026 年企业 AI 最常见的死法。Gartner 的预测更直白:到 2027 年底,超过 40% 的 agentic AI 项目会被取消,原因不外乎成本失控、业务价值说不清、风险控制不足(来源:https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027)。北美 3PL 巨头 Kenco 的三个月部署给出另一条路径:六个 Agent 送入生产、零客户中断,另有 20 个在 12 个月内排期(来源:https://finance.yahoo.com/technology/ai/articles/deepfabric-lands-kenco-scales-supply-110000664.html)。我们的判断:试点与生产之间的那道鸿沟,本质是测量问题,不是模型问题——先决定测什么,再决定自动化什么;先有基线,再谈 KPI。
Kenco 的规模本身就说明了为什么它值得看:141 个配送设施、4300 万平方英尺仓储、覆盖 33 个州与加拿大(来源:https://kencogroup.com/)。在这个网络里,每一次交接都是一份要有人核对的文档——仓库验证承运商、承运商验证客户、客户验证仓库,每一段都是独立的对账。DeepFabric 用三个月把六个 Agent 送进商业、运营、运输与客户服务四个条线的生产环境;Kenco 首席运营官 David Caines 称,六个 Agent 上线全程没有中断任何一位客户的服务(来源:https://finance.yahoo.com/technology/ai/articles/deepfabric-lands-kenco-scales-supply-110000664.html)。
货运审计、投标提案、库存管理是 DeepFabric 部署最广的三个 Agent。公司口径的数字:审计支出下降 45%、投标响应时间缩短最多 30%(来源:https://deepfabric.ai/press-releases/deepfabric-general-availability)。这两个数字与 Gartner 的 40% 预测放在一起,正是本文的切入口:同一个市场,一边预测 40% 取消,一边有人把 Agent 批量送进生产。
DeepFabric 创始人 Kalyan Kommineni 把测量问题放在自动化前面:「有效性优先于效率」。先问业务目标——同一批人做更多?加人但做更多?还是减工时?——目标不同,KPI 就不同。投标 Agent 的 KPI 是「不加人手能多追多少个标」,审计 Agent 的 KPI 是「每 100 张发票的人工工时」(来源:https://finance.yahoo.com/technology/ai/articles/deepfabric-lands-kenco-scales-supply-110000664.html)。
关键在时序:先有部署前的基线,部署,再测部署后的结果。「没有基线,什么都无法有效测量」——这句话看起来是常识,却是大多数试点卡死的地方:立项时写的是「上 Agent」,而不是「这个流程现在的数字是多少、部署后要变成多少」。
另一个反直觉的做法是承认失败并把它隔离出去。Kommineni 的原话:「Agent 天天都会失败,但我们要确保失败发生在非生产环境。」流程是:签 NDA → 拿客户真实数据 → 在客户数据上跑通 POC → 以最小风险尽快上生产。Agent 的失败从「上线的意外」变成「流程中的预期环节」——这正是「六个 Agent 上线零中断」的机制解释,而不是运气。
模型选择上,Kenco 案例给出的是中间路线:既不是「一个模型打天下」,也不是「每个用例定制 20 个模型」,而是按用例把请求路由到能力与价格最合适的模型。关键在于风险归属——模型切换与 token 经济学的风险由平台(DeepFabric)承担,客户不需要每天应对「今天模型又变了」。同时 Kenco 自己划了一条线:agentic AI 在护栏内完成任务,生成式 AI 做内容与洞察,人类通过平台内置的检查与覆盖路径保留审批权(来源:https://finance.yahoo.com/technology/ai/articles/deepfabric-lands-kenco-scales-supply-110000664.html)。
第一,Gartner 的 40% 是测量失败,不是模型失败。成本失控、价值不清、风控不足——三个原因都指向「先自动化、后测量」。谁在立项时先写下 KPI 与基线,谁就站在幸存的 60% 里。
第二,「先决定测什么」是最被低估的架构决策。KPI 必须绑定一个可观察的业务结果(不加人手的投标数、每 100 张发票的人工工时),而不是绑定技术指标(准确率、延迟)。绑定错了,Agent 再准也没有业务意义。
第三,失败隔离把「Agent 不靠谱」从事故变成流程。在客户真实数据上跑 POC、在非生产环境里让 Agent 失败——这个设计让「上线零中断」成为机制,而不是宣称。
第四,模型选择是中间路线,且风险要有人背。一个模型打天下或一堆定制模型都是极端;按用例路由 + 平台承担 token 经济学,是 Kenco 案例给出的现实解。采购时要问清楚:token 波动和执行的风险,谁来背?
第五,与 OOMeta 自家实践的呼应:我们以一人 + 多 AI 单元的架构运营,Agent 在 AQ 任务总线上执行、材料级动作保留人类审批——与 Kenco 划的「护栏内执行 + 人保留审批权」是同一条线。规模完全不同,但这条边界不是可选项,是前提。
第一步,立项时先写 KPI 与基线,再写用例。对每个候选 Agent 写下三行:它要改变哪个业务结果、这个结果现在的数字是多少(基线)、部署后多久再测。
第二步,按 Agent 类型定指标,不要一把尺子。投标类看「不加人手的产能」,审计类看「每 100 张发票的人工工时」——指标跟着业务目标走,而不是跟着「上没上 Agent」走。
第三步,把失败隔离写进流程。在客户真实数据上、非生产环境里跑 POC;上线前定义回滚与覆盖路径。承认会失败,然后在错误发生的地方拦住它。
第四步,问清 token 风险归属。谁承担模型切换与 token 波动的成本与执行风险?没有答案,就别谈规模化。留给你的决策问题是:你下一个 Agent 项目的 KPI 和基线,现在是写下来的,还是在脑子里?
参考来源: FreightWaves《DeepFabric lands Kenco as it scales supply chain agents》(2026-08-27, 经 Yahoo Finance 转载) — https://finance.yahoo.com/technology/ai/articles/deepfabric-lands-kenco-scales-supply-110000664.html ;Gartner 新闻稿《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》(2025-06-25) — https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027 ;DeepFabric GA 公告 — https://deepfabric.ai/press-releases/deepfabric-general-availability ;Kenco 官网 — https://kencogroup.com/
Gartner 2025-06 预测:到 2027 年底超 40% 的 agentic AI 项目会被取消,原因为成本失控、业务价值不清、风险控制不足。这是预测,不是已发生统计(来源:https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027)。
Gartner 列的三类取消原因——成本、价值、风控——全部可以用「先决定测什么」回答。Kenco 案例的存活模式 = 部署前基线 + 按 Agent 定 KPI + 失败隔离。
POC 阶段用客户真实数据在非生产环境跑通;「Agent 天天会失败,但要确保发生在非生产环境」(DeepFabric 创始人 Kalyan Kommineni 引述)。这是流程设计,不是运气。
先定有效性目标(同一批人做更多 / 加人做更多 / 减工时),再定指标。例:投标 Agent = 不加人手能多追多少标;审计 Agent = 每 100 张发票的人工工时。
DeepFabric 公司口径(其 GA 公告),未经独立审计。作为方向信号可用,作为采购依据不足。
中间路线:按用例把请求路由到能力与价格合适的模型;由平台承担 token 经济学与执行风险,客户不用每天应对模型变化。
Kenco 的划分:agentic AI 在护栏内完成任务,生成式 AI 做内容与洞察;人类通过平台内置的检查与覆盖路径保留审批权。
文档即策略:财务后办公室 AI 的共同骨架
Rivian 把采购应计自动化、Lemvigh-Müller 让超 90% 供应商确认免接触、丰田把设备诊断从 6 小时压到 3 分钟——三家互不相关的公司用了同一套骨架:业务逻辑写成文档而非代码、置信度分级放行、审计链是一等公民。ROI 数字是厂商自报,可信的是模式的重现。
800 个 Agent 不是故事:GE Appliances 的规模答案是数据平台
GE Appliances 披露已在制造、物流与供应链部署 800+ AI Agent(公司公告口径)。我们的判断:这个数字是滞后指标——真正让 800 个 Agent 成立的是统一工厂数据平台 Brilliant Factory 与工人直达数据的访问层。抄数量不抄底座,只会得到 800 个孤岛。
客服 AI 的第二幕:量级层交给机器,价值层留给人
Klarna 2025 年公开回调、Kogan.com 用『真实解决率』校准、BILL 以 70% AI 解决率省下 500 万美元:客服 AI 第一波已证明量级层可被机器吸收,真正稀缺的是边界设计、指标选择与省下产能的再配置。
花旗 Arc 平台:最大规模实测的企业级 Agent 部署
花旗4月推出Arc,把AI Agent当集中式操作系统:18万员工用AI、4万开发者用Devin做Agentic编码、每周超10万Agent小时。遗留系统迁移从12个月缩到4周,50亿美元投入靠Agent自产的效率节省回血。