2026 年 9 月 · 5 分钟阅读

关键定义
推理支出(Inference Spend) 运行已训练模型处理请求产生的持续成本,区别于一次性训练成本。Gartner 数据:2026 年全球推理支出 233 亿美元首次超过训练支出 190 亿美元。
Token-as-a-Service(TaaS) 一类新的推理提供商:在自有硬件上托管开放权重模型,按 token 计费出售推理能力。Equinix 判断多数企业不会自托管开放权重,而会从 neocloud/TaaS 平台购买 token。
切换权(Switching Power) 在不重建系统、不迁移数据、不重写调用的前提下更换模型或提供商的能力,由 provider-agnostic 接入层与路由层保证。它是 2026 年推理采购中最值得购买的资产。
2026 年,企业 AI 的成本重心换边了:Gartner 数据显示,全球推理支出(233 亿美元)这一年首次超过训练支出(190 亿美元);更陡的是,每个 agentic 工作流的推理成本到 2028 年将增长 5 倍以上(来源:Equinix 博客引用 Gartner — https://blog.equinix.com/blog/2026/09/10/where-ai-inference-needs-to-run/ )。这不是预算表上的小挪动,而是问题的性质变了:训练是资本开支,推理是运营成本——后者每个季度都要重新回答一次。大多数企业的采购框架还停留在「选哪个模型」,2026 年的正确问题是:你的推理跑在哪、谁来跑、你能不能换。
Gartner 的预测把拐点钉死了:2026 年推理支出 233 亿美元超过训练 190 亿美元,AI 优化的 IaaS 支出全年增长 96%(来源:Gartner 08-10 新闻稿 — https://www.gartner.com/en/newsroom/press-releases/2026-08-10-gartner-forecasts-worldwide-artificial-intelligence-optimized-iaas-spending-to-grow-96-percent-in-2026 );到 2028 年,每个 agentic 工作流的推理成本将比现在高 5 倍以上(来源:Gartner 08-17 新闻稿 — https://www.gartner.com/en/newsroom/press-releases/2026-08-17-gartner-predicts-ai-inference-costs-per-agentic-workflow-will-increase-more-than-fivefold-through-2028 )。
Equinix 的机制解释值得引用:这是「消费问题」——聊天机器人读一个 prompt、回一句话;agent 要理解目标、决定动作、调用工具、协调其他 agent、评估进度,然后重复循环。Agent 天生多动作,消费增长快于任何模型降价能抵消的效率提升(来源:Equinix — https://blog.equinix.com/blog/2026/09/10/where-ai-inference-needs-to-run/ )。
我们的判断:训练成本是一次性、可分摊、相对可预测的资本开支;推理成本是持续、非线性(随 agent 动作数膨胀)、由架构决定的运营支出。把「训练贵」的旧直觉带到 2026,会系统性低估 agent 规模化的真实账单——5 倍增长不是模型涨价,是工作流动作数的增长。
Equinix 提出了一个值得写进采购文档的论点:每 token 成本不是模型的属性,而是配置的属性——硬件代际、利用率、请求批处理方式、以及工作负载离数据的距离,决定了真实成本。两个企业通过不同提供商调用同一个开放权重模型,每个有用结果的价格可以差很多(来源:Equinix — https://blog.equinix.com/blog/2026/09/10/where-ai-inference-needs-to-run/ )。
与之配套的是消费模式的分岔:「大多数企业不会自己运行开放权重模型——他们会从一类新的专业提供商、neocloud 和 Token-as-a-Service 平台购买 token,这些平台在自有硬件上提供开放模型」(来源:Equinix — 同上 URL)。自托管换主权与控制,但背上运维与资本支出;TaaS 换轻资产,但把成本与依赖交给外部。
我们的判断(内部实证):OOMeta OS 运行多模型梯队——默认档 deepseek-v4-flash(成本档)、复核档 gemini-3.5-flash、必要时才升级旗舰模型。我们的运营数据支持三件事:① 同一任务在不同提供商与配置下的有效成本差可达数倍;② 保持模型与提供商可切换(provider-agnostic 接入层 + 路由层)本身就是最大的成本保险——锁死单一提供商,等于把 5 倍增长变成不可谈判的账单;③ 成本测量单位必须是「每完成任务的成本」:任务成本 = 模型选择 × 配置 × 放置 × 重试次数,单价只是其中一个系数。
切换权(switching power)指:在不重建系统、不迁移数据、不重写调用的前提下,更换模型或提供商的能力。Equinix 明确指出 neocloud/TaaS 市场的碎片化是「刻意设计」——它给企业每一个 hop 真实的选择,而只够得着一个提供商的企业没有任何杠杆(来源:Equinix — https://blog.equinix.com/blog/2026/09/10/where-ai-inference-needs-to-run/ )。
我们的判断:碎片化是双刃剑——切换权的前提是切换成本足够低。架构原则有三条:把提供商当可替换组件;把成本、延迟、质量做成每个提供商可比较的维度;把账单、延迟、质量沉淀为决策数据。我们自己的做法是路由层 + 上下文工程 + 每任务成本度量,让「换模型」从架构事件降级为配置事件。
1. 预算单位改成「每任务成本」。
列出 top 10 业务任务,计算每个任务的模型 × 配置 × 提供商组合的真实成本(含重试与缓存命中)。单价对比表是乘法里最小的系数。
2. 把可切换性写进架构与合同。
数据可导出、API 兼容、无独占绑定;对每个提供商做退出演练,就像做灾备演练一样。
3. 推理放置按数据主权分层。
敏感数据走私有连接与本地区域,一般负载走成本优先;别让最贵的一跳决定整体经济学。
4. 对 5 倍预测做压力测试。
2028 年你的 agent 工作流数量 × 每任务成本,预算跟得上吗?跟不上,现在就要设计降级路径与路由上限。
留给买方的问题
下次听到「我们的模型便宜 30%」时,先问:你能在多长时间内换成下一个便宜 30% 的提供商,而不重建任何东西?如果答案是「需要一个季度」,你买的不是便宜,是另一份不可谈判的账单。
参考来源:Equinix《Where AI Inference Needs to Run》(09-10)— https://blog.equinix.com/blog/2026/09/10/where-ai-inference-needs-to-run/ ;Gartner 08-10 新闻稿(AI 优化 IaaS 支出 +96%)— https://www.gartner.com/en/newsroom/press-releases/2026-08-10-gartner-forecasts-worldwide-artificial-intelligence-optimized-iaas-spending-to-grow-96-percent-in-2026 ;Gartner 08-17 新闻稿(agentic 工作流推理成本 5 倍)— https://www.gartner.com/en/newsroom/press-releases/2026-08-17-gartner-predicts-ai-inference-costs-per-agentic-workflow-will-increase-more-than-fivefold-through-2028
Gartner 数据:2026 年全球推理支出 233 亿美元超过训练 190 亿,AI 优化 IaaS 支出全年增长 96%。机制上这是消费问题——agent 天生多动作,消费增长快于模型降价能抵消的效率提升。
Equinix 的论点:每 token 成本是配置的属性——硬件代际、利用率、批处理方式、离数据的距离决定真实成本;两个企业通过不同提供商调用同一模型,每个有用结果的价格可以差很多。
没有唯一答案:自托管换主权与控制,但背上运维与资本支出;TaaS 换轻资产,但把成本与依赖交给外部。决策维度是数据主权、团队运维能力与任务量级,而不是模型本身。
每个业务任务的实际总成本 = 模型选择 × 配置 × 放置 × 重试次数,含缓存命中与批量折扣。它是预算单位:列出 top 10 任务逐一计算,而不是只对比每百万 token 单价。
在不重建系统、不迁移数据、不重写调用的前提下更换模型或提供商的能力。获得方式:provider-agnostic 接入层、路由层、数据可导出、API 兼容、无独占绑定,并对每个提供商做退出演练。
每个 agentic 工作流的推理成本到 2028 年将比现在高 5 倍以上(Gartner 08-17)。它不是模型涨价,而是 agent 动作数的增长;买方现在就要做压力测试与降级路径设计。
开源权重智能体模型:先验证,别轻信厂商口径
Abacus.AI 09-10 发布 Smaug 系列开源权重智能体模型,声称长时 agent 循环提升 15-20%、成本低 10-100 倍(厂商口径,未独立验证)。我们的判断:开源权重让厂商声称第一次可以被买方自己验证——评估单位应从 token 价格变成「每个完成任务的成本」。
agent 成本的第一控制变量是上下文:缓存命中率比 token 单价更真实
两份 2026 实测:提示缓存降 agent 成本 41-80%(arXiv 2601.06007),命中率 7%→84%、成本降 59%;keepalive 显示 Anthropic 5 分钟 TTL 下 4 分钟心跳最优。我们的判断:缓存命中率才是 agent 成本 KPI,上下文布局是唯一免费无损的降本杠杆。
token 价格战:单价不再是成本决策的第一变量
OpenAI 07-30 把 Luna 砍价 80% 至 $0.20/M 输入,Anthropic 08-11 把 Sonnet 5 的 $2/$10 定为永久价。我们的判断:价格战让「选哪个模型」失去意义,账单改由 token 卫生决定——缓存命中率、批量占比、重试与上下文膨胀。
Agent 成本治理进入执行层:Sapiom 3500 万美元的架构选择
Sapiom 融资 $35M(09-08,Dragonfly 领投,累计 $50M):把 agent 成本治理做成执行层基础设施——预算权限先于执行、调用实时选路、全量 metering(厂商口径)。我们的判断:agent 财务治理必须发生在执行点,不是另一块仪表盘;「省 75%」是厂商声称,需独立验证。