2026 年 9 月 · 6 分钟阅读

关键定义
生产力 J 曲线 每 1 美元有形技术投入伴随最高 10 美元的无形投入(流程再造、组织变革、数据地基),初期生产率先降后升。低谷期的难看是投资形状,不是失败(Brynjolfsson-Rock-Syverson 2021)。
eval-first(评估优先) 把「完成质量与业务结果」做成每个迭代版本的可回滚门槛,而不是等项目结束再回头看工时。斯坦福样本里每一个成功项目都用了迭代法。
同样的 AI 用例,一家 fintech 用几周跑完,一家银行说「光搭起来就要好几年」。差距不在模型,在计量。斯坦福数字经济实验室 2026 年 4 月的《Enterprise AI Playbook》复盘了 51 个真实部署(41 家组织、覆盖 100 万+ 员工):77% 的「最难问题」是流程、数据、组织这类隐形成本;61% 的组织在今天的成功之前有过一次失败;agentic 中位生产力提升 71%,高自动化是 40%,人机协同只有 22%。价值就在那里——看不见它,是计量设计的问题。
斯坦福团队(Pereira、Graylin、Brynjolfsson)用 5 个月访谈了 41 家组织里已上线、被业务持续使用、能量化价值的 51 个 AI 项目,覆盖 9 个行业、14 类职能。三个数字值得记住:
77% 的难题是隐形成本。被问「最难修的是什么」时,答案集中在变革管理、数据质量、流程再造——技术被一致描述为「最容易的部分」。第二,61% 的成功者之前失败过一次:失败的模式高度一致——把 AI 当技术项目而不是流程与变革项目。第三,同样的用例,从几周到几年:fintech 用 AI 编码 agent 迁移数百万行遗留 ETL 代码只花了几周,一家大银行做同类客服改造自称「要好几年」。斯坦福的结论:差距从来不是模型,是组织的地基、流程与测量。
agent 的数据同样反直觉。按自主层级分组的中位生产力:agentic 71%(区间 20-80%,现场服务 80% 最高)、高自动化 40%(IT 运维 90% 最高)、人机协同 22%(发票 85% 最高)。自主层级越高、中位越高——但完全自主的实现只占样本的 20%。METR 的测量给出同一方向:最强模型已能可靠完成约 15 小时的人类专家任务,且这条能力线还在加速。
J 曲线(Brynjolfsson-Rock-Syverson 2021)描述:每 1 美元有形技术投入伴随最高 10 美元的无形投入——流程再造、组织变革、数据地基。初期产出难看是投资形状,不是失败。但多数企业用滞后指标测量:每月工时、季度报表。滞后指标在低谷期必然难看,于是项目在回报兑现前被砍。误判的不是项目,是测量。
压平低谷靠三件事。第一,eval-first:业务指标从第一周就接线——完成质量、任务成功率、业务结果——而不是等三个月看工时。第二,迭代而非大爆炸:斯坦福样本里每一个成功项目都用了迭代法,没有例外。第三,把 1:10 的无形投入写进预算和评估窗口:不写进去,你会在低谷正中央砍掉本该成功的项目。
71% vs 40% vs 22% 还有一层含义:agent 的价值集中在「完全自主、完成质量可测、错误可恢复」的场景——现场服务、IT 运维、发票。这类场景的价值长在质量与完成率上,不在工时上。你唯一能看见它的方式,是把 eval 做成业务指标的闭环;做不到,你看到的只有月度报表里那个还在下跌的工时曲线。
① 首周就接线业务指标
完成质量、任务成功率、业务结果——不等到第三个月。滞后指标只会在低谷期给你「砍掉它」的信号。
② 用 eval 门槛,不用「感觉」
每个迭代版本设可回滚的评估门槛,不过门槛不接业务动作。门槛本身也是成本杠杆。
③ 把 1:10 无形投入写进评估窗口
预算与董事会评估都要显式包含流程再造与变革成本——否则你会在低谷正中央砍掉该成功的项目。
④ 迭代发布,别大爆炸
斯坦福样本里每个成功项目都用迭代法。把「几周 vs 几年」的差距看成组织与测量问题,而不是模型问题。
衡量建议:把「每月工时」从主指标降级为参考,主指标换成「每任务完成质量 + 成功率 + 业务结果」。评估窗口显式写进 1:10 的无形投入。这样你在低谷期看到的是「投入正在累积」,而不是「回报还没来」。
OOMeta AI
OOMeta 内部就跑 eval-first:1 个人 + 多 agent 单元,每个单元产出先过评估门槛再接业务动作,迭代版本而不是大改——从产品工程复制到内容生产与审计。这不是质量洁癖,是让低谷期不杀死项目的计量设计。给客户的第一条建议也是同一句:先修计量设计,再谈模型。
预约诊断会参考来源:斯坦福数字经济实验室《The Enterprise AI Playbook: Lessons from 51 Successful Deployments》(2026-04,Pereira/Graylin/Brynjolfsson)https://digitaleconomy.stanford.edu/app/uploads/2026/03/EnterpriseAIPlaybook_PereiraGraylinBrynjolfsson.pdf · J 曲线模型源自 Brynjolfsson, Rock & Syverson, “The Productivity J-Curve” (2021),经该报告转述
斯坦福复盘 51 个真实部署后发现:差距从来不在模型,在组织。加速因素是高管背书(43%)、站在已有地基上(32%)、终端用户愿意用(25%);拖慢因素是学习曲线(25%)、数据质量(21%)、合规(21%)、流程文档缺口(21%)。
J 曲线描述的是「1 美元有形投入伴随最高 10 美元无形投入」:初期产出难看是投资形状。但多数企业用滞后指标(每月工时、月度报表)测量,它们在低谷期必然难看——于是项目在回报兑现前被砍。这是计量设计失败,不是结果失败。
斯坦福样本里按自主层级分组:agentic(端到端自主)中位提升 71%,高自动化(>80% 自主、人看例外)40%,人机协同 22%。最高单点:现场服务 80%、IT 运维 90%、发票 85%。价值存在,只是标准报表看不见。
三件事:① 业务指标从第一周接线(完成质量、任务成功率、业务结果),不等到第三个月;② 每个迭代版本设可回滚的评估门槛,不过门槛不接业务动作;③ 迭代发布而不是一次性大改。
OOMeta 内部每个 agent 单元的产出先过评估门槛再接业务动作,迭代版本而不是大改;这套 eval-first 从产品工程复制到内容生产与审计。给客户的第一条建议也是同一句:先修计量设计,再谈模型。
被“卡住”的自动化:企业 Agentic AI 为何大面积停滞
停滞的根因常被归给模型,实际是上下文与流程问题——与本文「先修计量与组织」同一判断。
采用狂奔,EBIT 原地不动:企业 AI 的规模-回报断层
宏观的规模-回报断层,到项目层面就是本文的计量设计问题——断层在报表里,也在测量方式里。
AI Agent ROI 2026:把散落的数字拼成一张图
散落的 ROI 数字需要一个统一的读法——agentic 71% 这类中位数正来自斯坦福这样的实证样本。
评估优先不是质量洁癖:Zepto 把 eval 做成了成本杠杆
Zepto 证明 eval 门槛本身就是成本杠杆——本文的「修计量设计」在工程层的落地。