2026 年 9 月 · 5 分钟阅读

关键定义
狗粮测试(dogfood test) 判断供应商是否值得信任的标准:它是否先在自己内部大规模运行自己对外销售的产品或方案。咨询语境下即:这家公司自己跑不跑 Agent、拿不拿得出内部数据证明。
副驾型 Agent(copilot-class agent) 辅助人类完成搜索、综合、起草等单步任务的 Agent,人类仍负责决策与执行。麦肯锡自称节省的 150 万小时属于此类(search and synthesis),与端到端自主执行完整工作流的 Agent 是两种能力。
AI 高绩效企业(AI high performer) McKinsey 定义:把组织 ≥5% 的 EBIT 归因于 AI 使用且认为影响「显著」的企业。2026 年全球调查中仅占 6%,与 2025 年持平。
选 AI 咨询伙伴,先问它自己跑不跑 Agent,再看它拿什么数据证明。麦肯锡 2.5 万 Agent 与 4 万人并行、EY 九个月建 5 万 Agent、Wipro 把「自己就是参考案例」当卖点——咨询业正在大规模「吃自己的狗粮」。但内生数字多为自报:麦肯锡自家调查里,仅 6% 企业把 ≥5% EBIT 归因于 AI。这篇把「狗粮测试」做成可执行的尽调标准。
麦肯锡 CEO Bob Sternfels(HBR IdeaCast 播客):公司 40,000 名员工旁运行约 25,000 个个性化 Agent,目标年底接近 1:1;去年在搜索与综合类工作节省 150 万小时;六个月生成 250 万张图表——这一数字未被独立核实。来源:Yahoo Finance 报道 与 TechTimes 报道。
EY:据官方案例研究,九个月内构建 50,000+ 个 Agent;EY.ai EYQ 部署给 300,000+ 专业人员;平台与微软(编排层)、英伟达联合构建,官方称「先喝自己的香槟」再与客户分享。来源:EY 官方案例研究。
Wipro:CIO Kenny Kesar 在 Google Cloud Consulting 视频访谈里说「we are our own reference」——110 亿美元营收的服务商先在内部孵化、验证方案再卖给客户;已在 Gemini Enterprise 上为 15,000 名员工部署 90 个编排式 Agent。来源:Wipro/Google 视频访谈摘要。
麦肯锡 2026《State of AI》全球调查(1,719 位受访者,2026 年 5 月 4 日–6 月 8 日):88% 组织在至少一个业务职能常规使用 AI;但仅 39% 报告任何程度的 EBIT 影响(其中多数低于 5%),仅 6% 属于「AI 高绩效企业」(≥5% EBIT 归因 + 认为影响显著)——与 2025 年持平。来源:McKinsey 官方调查页。
换句话说:全行业(包括咨询公司自己)的 AI 支出,绝大多数还没变成企业级 EBIT;而咨询公司用来卖课的「自家 150 万小时」,属于副驾型工作(搜索与综合),不是端到端自主执行的 Agent 工作。
第一层(数量):它自己跑多少个 Agent?没有内部 Agent 的咨询公司不配卖 Agent 方案——它连自己都没跑过。第二层(类别):它的 Agent 处理什么类别的活?副驾型(搜索、综合、起草)与端到端型(自主执行完整工作流并处理异常)是两种完全不同的能力;不区分类别的「节省 X 小时」,等于没有数字。第三层(审计):它的内部数字有没有被独立验证过?自报数字是「证据的愿望」,独立审计才是证据。
我们的判断:狗粮是必要不充分条件。它证明「这家公司至少没在卖自己都不敢跑的东西」,但不证明「它跑出来的东西能在你的组织里复现」——后者取决于你自己的流程与数据,不取决于它卖的任何模板。
① 你们内部跑多少个 Agent?在哪些职能?上线多久了?
没有内部 Agent 的咨询公司,不配卖 Agent 方案。
② 它们的活是副驾型还是端到端型?
能不能列出「自主完成、无需人接管」的占比?两类能力差别巨大,不区分类别等于没数字。
③ 你们节省了多少小时?用什么指标定义「节省」?基线是什么?
没有基线的时间数字无法检验;要求给出口径(时间段、样本、对比对象)。
④ 出错率与升级路径是什么?
多少个 Agent 出过越界事件?是事后发现还是实时发现?回答越具体越可信。
⑤ 这些内部数字有没有第三方审计?
没有的话,哪些可以开放给你做独立验证?自报数字按厂商口径打折。
行动:把五个问题放进 RFP 或尽调清单;要求候选咨询伙伴出示内部 agent 遥测(数量、类别、基线、出错率、审计状态);对任何「效率提升 X%」要求给出口径定义;把「愿意开放独立验证」设为加分项,把「只有案例研究」设为风险项。
留给买家的决策问题:你现在的 AI 咨询伙伴,能答出这五个问题里的几个?如果它连自己都不跑 Agent,你凭什么相信它能替你跑好?
OOMeta AI
OOMeta 的立场与做法:狗粮测试就是我们的运行方式——我们只交付自己内部跑过的方案,并愿意用内部遥测与独立验证接受客户尽调。本文把这一标准写成买方可复用的清单,正是为了把「案例研究」式销售赶出这个市场。
预约诊断会参考来源:McKinsey《The State of AI: Global Survey 2026》https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai ;Yahoo Finance(McKinsey CEO:25,000 Agent / 150 万小时)https://finance.yahoo.com/news/mckinseys-ceo-breaks-down-ai-100301404.html ;TechTimes(McKinsey 2026 调查:6% 高绩效;250 万图表未独立核实)https://www.techtimes.com/articles/325590/20260826/record-ai-spending-cant-move-earnings-needle-94-enterprises-mckinsey-finds.htm ;EY《Building an enterprise-scale agentic AI operating system》https://www.ey.com/en_gl/insights/ai/building-an-enterprise-scale-agentic-ai-operating-system ;Wipro / Google Cloud Consulting 视频访谈(90 Agent / 15,000 员工,we are our own reference)https://www.technology-in-business.net/new-way-now-wipro-scales-agentic-ai-for-15000-associates-with-google-cloud-consulting/
据其 CEO Bob Sternfels 在 HBR IdeaCast 披露:40,000 名员工旁运行约 25,000 个个性化 Agent,目标年底达到与员工数接近 1:1;去年在搜索与综合类工作节省 150 万小时;六个月生成 250 万张图表(未被独立核实)。
据 EY 官方案例研究:九个月内构建 50,000+ 个 Agent;EY.ai EYQ 已部署给 300,000+ 专业人员;平台与微软(编排层)、英伟达联合构建;官方称「先喝自己的香槟」再给客户。
Wipro CIO Kenny Kesar 在 Google Cloud Consulting 视频访谈中说「we are our own reference」:作为 110 亿美元营收的服务商,先在内部孵化并验证方案再卖给客户;已在 Gemini Enterprise 上为 15,000 名员工部署 90 个编排式 Agent。
麦肯锡的 25,000 Agent、150 万小时、250 万图表均来自公司自述(其中 250 万图表明确未被独立核实);EY 与 Wipro 的数字出自厂商/合作伙伴的案例叙事,没有第三方审计。
麦肯锡 2026《State of AI》全球调查(1,719 位受访者,2026 年 5 月 4 日–6 月 8 日):88% 组织在至少一个业务职能常规使用 AI;仅 39% 报告任何程度的 EBIT 影响(其中多数低于 5%),仅 6% 属于「AI 高绩效企业」——与 2025 年持平。
① 你们内部跑多少个 Agent、在哪些职能、上线多久?② 它们是副驾型还是端到端型?③ 节省了多少小时,基线是什么?④ 出错率与升级路径是什么?⑤ 内部数字有没有第三方审计?回答越具体、越敢给基线与方法、越敢接受独立验证的,越值得信任。
「先发不是先赢」:Agent 回本是工作流设计问题
Salesforce 全球 2025 位 agentic AI 决策者调查:最快回本的行业(专业服务 6.5 个月)不是部署最快的;完美数据不是前提;治理越重回本越慢、漏检却翻倍;嵌入工作流比任何单点能力都重要。给 C-suite 的可执行上线顺序:先选有界工作流,再谈规模。
agent 规模化死在预算错配:78% 试点、14% 上线的五个缺口
2026-03 对 650 位企业技术负责人的调查:78% 有 agent 试点、仅 14% 到生产规模;89% 的失败可归因 5 个缺口(集成 63%/质量 58%/监控 54%/归属 49%/领域数据 41%)。我们的判断:规模化是 build-vs-operate 失衡——把钱从模型选型挪到 eval 与监控。
FDE 军备竞赛:上千工程师进场,谁留下证据?
Google Cloud 与 Accenture 成立 Gemini Enterprise Business Group,训练 1,000 名前向部署工程师。五支部署军团(微软/OpenAI/Anthropic/AWS/谷歌)全部以人头数作为承诺单位——但没有一支回答:工程师离场后,谁独立核验 agent 做了什么?
采用狂奔,EBIT 原地不动:企业 AI 的规模-回报断层
McKinsey 2026 调查:营收 10 亿美元以上企业规模化 AI agent 一年从 27% 涨到 40%,但报告 EBIT 影响的比例卡在 37% 两年不动,高绩效者仅 6%。断层在扩大,根因不是模型或平台——高绩效者 73% 围绕 AI 重建了工作流,其他企业只有约 25%。个人生产力不自动上资产负债表。