2026 年 9 月 · 6 分钟阅读

关键定义
用量计费(consumption metering) 按 token 消耗计量费用的定价方式,而非按席位收固定费。Claude Code 不按人头收费,它按模型调用消耗的 token 计费——同一名工程师、同一个工作日,只跑自动补全与并行起 10 个 agent 重构代码库,账单可能相差 5–20 倍。
席位定价(per-seat pricing) 按用户数收固定月费的模式,例如 Microsoft 365 Copilot Enterprise 的 30 美元/人/月。财务团队可以拿人头数直接乘出全年预算;代价是厂商在重度用户身上赚不到增量。两种模式都成立,把它们当一回事才会出事。
承诺消费协议(committed-spend agreement) 与厂商锁定固定金额、固定费率的采购协议,用承诺用量换价格可预测性。Uber 事件后,想要预算可预测的采购团队需要谈这种协议,而不是裸奔在消费定价上。
当 84% 的工程师都在用同一个编码 agent,预算问题就不再是「要不要用」,而是「怎么为它记账」。Uber 在 2026 年 4 月就烧光了全年 AI 工具预算——工具没有失败,工程师没有滥用,他们只是用它做了设计上就该做的事:并行 agent、大规模重构、自动化测试。我们的判断:编码 agent 的失败模式不是拒绝采用,而是无治理的拥抱;用量计费的工具需要 DevOps 级的成本控制。来源:Forbes 报道,公司口径。
Uber 在 2025 年 12 月向工程组织铺开 Claude Code,采用率从 2 月的 32% 一路涨到 3 月的 84%(被归为 agentic coding 用户);到春天,95% 的工程师每月都在用 AI 工具,约 70% 的提交代码由 AI 生成,约 11% 的线上后端更新由 agent 编写且无人工介入。CTO Praveen Neppalli Naga 向 The Information 承认超支,原话大意是「我以为够用的预算已经被吹走了」。Uber 2025 年研发支出 34 亿美元、同比增 9%——预算崩盘不是规模问题,是财务团队还没学会管理的定价模型问题。
成本数字的分布才是关键:人均月成本平均 150–250 美元,重度用户 500–2,000 美元,CTO 本人一次两小时演示花掉 1,200 美元。工程师没有偷懒,他们用在了并行 agent 执行、大规模代码库重构、自动化测试生成和后台代码生产上——从生产力角度看这次 rollout 是成功的,从财务角度看它是失控的。
Claude Code 不按席位定价,它按模型调用消耗的 token 计量。一名只跑自动补全的工程师消耗的 token,是另一名在 monorepo 上并行编排 agent 的工程师的零头——同一工具、同一人、同一工作日,账单方差巨大。建立在「每人固定许可证费」上的年度预算周期,吸收不了这种方差。
对照 Microsoft 365 Copilot Enterprise 的 30 美元/人/月固定价:价格封顶了厂商的增量收益,却给了财务一个可以乘以人头数的平直线条。Anthropic 的消费模型让厂商在重度用户身上拿到无限增量,让财务几乎没有前瞻可见性。两种模型都成立,但把它们当成可互换的预算科目,就是 Uber 的结局。Uber 还做了一件事让情况更糟:按 Claude Code 使用量给工程师排名——排行榜把 token 消费变成竞赛,推动采用的人和管成本的人不是同一批人,这个组织断层就是失控的承重墙。
Uber 的个案背后是一个正在发生的定价迁移。Anthropic 5 月 13 日宣布:6 月 15 日起,付费 Claude 订阅用户的 agent 工具和第三方 harness 使用将单独计量、按完整 API 价格计费;GitHub 6 月 1 日把 Copilot 改为积分制。分析师预期未来 12–24 个月多数厂商都会引入独立的 agent 用量池——词汇会变(credits、requests、messages、compute units),方向已定:无上限的订阅价从未撑得住无边界 agentic 工作负载的数学,厂商会把成本机制转嫁给买方。
行业对消费成本故事的标准回应是「AI 会通过生产力自己买单」。Uber 的案例让这个辩护变复杂:资深工程师跑 agentic 工作流的边际收益,必须跨过比跑自动补全高得多的 token 成本门槛;agentic 模式下每开发者消耗放大 5–20 倍已被记录,但没有公开基准显示产出价值有同等倍数提升。更麻烦的是,生产力收益和 AI 成本不进同一个科目,财务无法在季度复盘里对冲。
我们的立场:试点经济学预测不了规模经济学。试点是几个工程师跑自动补全,生产是整队人把多步工作流委托给 agent——用量差一个数量级。行业数据也印证了治理缺位:只有 43% 的组织有正式的 AI 治理政策,只有 21% 有成熟的 agentic 治理。大多数企业还没有对 AI 工具施加 DevOps 对云算力早就施加的支出控制:每工程师上限、token 实时监控、超支预警而不是事后算账。Uber 在没有任何控制的情况下全组织铺开,一个季度内就看到了结果。
1. 把 token 当云算力管
每工程师、每团队设置 token 预算,配实时用量监控和超支预警——这是 DevOps 对云成本的纪律平移,不是新的治理发明。
2. 撤掉或封顶用量排行榜
任何奖励使用而不设上限的 rollout,都应该按无上限负债建模。要激励就激励质量指标(缺陷率、交付周期),不是 token 消耗量。
3. 成本模型区分工作流类别
自动补全与多 agent 编排是两种成本曲线,分开建模、分开预算。让财务知道「编排型工作流」的单价是「补全型」的 5–20 倍。
4. 谈承诺消费固定费率
想要可预测性的采购团队应谈 committed-spend 协议;谈判筹码取决于工程侧有没有用量上限。没有上限就没有筹码。
Uber 没有减速:Naga 计划并行测试 OpenAI Codex,长期愿景是 agent 工程师负责编码、测试、部署,人类做编排。这个方向与主流工程组织一致——留给董事会的开放问题不是要不要部署,而是当工程师不再收着用的时候,财务有没有可见性。
行动:任何编码 agent 全组织铺开前,先装好四件控制(token 预算、无排行榜、工作流分类建模、承诺费率);试点成本不等于规模成本,别用试点数字做全年预算。留给买方的问题:你们组织里一名重度 agent 用户的月成本是多少,财务有没有实时看到它?答不上来,你们就是下一个四个月烧完预算的公司。
OOMeta AI
OOMeta 的立场:用量计费的编码 agent 需要把成本控制当成上线前提,而不是事后补救——token 是新的算力科目,FinOps 纪律直接平移。Uber 的教训是组织级的:奖励使用而不设上限,就是把预算变成无上限负债。我们也按此运营自己的 agent 流水线:每任务预算、实时计量、超支即告警。
预约诊断会参考来源: Forbes, Uber Burns Its 2026 AI Budget In Four Months On Claude Code(公司口径,Janakiram MSV 2026-05-17)https://www.forbes.com/sites/janakirammsv/2026/05/17/uber-burns-its-2026-ai-budget-in-four-months-on-claude-code | The Information 对 CTO Praveen Neppalli Naga 的采访(经 Forbes 引用)https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-ai-budgets | Anthropic 订阅 agent 用量单独计量公告(Axios 2026-05-14 报道)https://www.axios.com/2026/05/14/anthropic-claude-price-openai-tokens | GitHub Copilot 积分制(SiliconANGLE 2026-05-14)https://siliconangle.com/2026/05/14/anthropic-announces-programmatic-credit-pool-agentic-tool-use-rises/ | InfoWorld 对行业消费池化的分析 https://www.infoworld.com/article/4171274/anthropic-puts-claude-agents-on-a-meter-across-its-subscriptions.html
Uber 在 2026 年 4 月就耗尽全年 AI 工具预算。Claude Code 采用率从 2 月的 32% 涨到 3 月的 84%,约 70% 的提交代码由 AI 生成,约 11% 的线上后端更新由 agent 无人工编写。人均月成本平均 150–250 美元,重度用户 500–2,000 美元,CTO 本人一次两小时演示花了 1,200 美元。来源:Forbes 报道,公司口径。
席位预算是人头数乘以固定单价,全年可预测;token 计费按使用量走,同一工具、同一工程师、同一工作日,不同工作流(自动补全 vs 并行多 agent 重构)会产生截然不同的账单。年度预算周期无法吸收这种方差,这是 Uber 烧穿预算的结构性原因。
Uber 按 Claude Code 使用量给工程师排名,等于把 token 消费变成一场竞赛。推动采用的人和管理成本的人不是同一批人,这个组织断层就是预算失控的承重墙:奖励使用而不设上限,就应该把成本当成无上限负债来建模。
Anthropic 5 月 13 日宣布,6 月 15 日起付费 Claude 订阅用户的 agent 工具与第三方 harness 使用将单独计量、按 API 全价收费;GitHub 6 月 1 日把 Copilot 改为积分制。分析师预期未来 12–24 个月多数厂商会把 agent 用量单独设池——无上限的订阅价撑不住 agentic 工作负载。
agentic 模式下每开发者消耗可能放大 5–20 倍,但没有公开基准显示产出价值有同等倍数的提升;而且生产力收益不进 AI 成本这个科目,财务团队无法在季度复盘里做对冲。生产力和成本出现在不同账本上,就不能互相抵消。
四件套:①每工程师/每团队 token 预算加实时监控(把 token 当云算力管);②撤掉或封顶用量排行榜;③成本模型区分自动补全与多 agent 编排两类工作流;④与厂商谈承诺消费固定费率,采购谈判筹码取决于工程侧有没有用量上限。
Farmers 释放 1,640 万小时:省下的时间去哪了
Farmers Insurance 两年目标落地:约 8,000 名代理与 2 万员工把例行服务工作量削减 35%,释放约 1,640 万小时/年转向销售与客户关系。我们的判断:省下的时间是负债,重新分配才是收益。
推理支出首次超过训练:企业 AI 采购从选模型变成买配置与切换权
Gartner:2026 年推理支出 233 亿美元首次超过训练 190 亿。成本单位不是模型单价而是配置与放置——切换权才是 2026 年最该买的资产。
400 席位、每席 14 美元:受监管行业的 agent 成本开始显形
德国保险经纪 MRH Trowe 约 400 名员工用上自服务 agent,上线首月约 $14/席/月。我们的判断:「治理包含在内」的价格才是真价格。
采用狂奔,EBIT 原地不动:企业 AI 的规模-回报断层
McKinsey 2026:规模化 AI agent 一年从 27% 涨到 40%,但报告 EBIT 影响的比例卡在 37% 两年不动。个人生产力不自动上资产负债表。