2026 年 9 月 · 5 分钟阅读

关键定义
档位下移(model tier step-down) 把生产负载从最强(也最贵)的前沿模型下移到低一档的模型,前提是能力差不足以支撑价格差。Vercel 实测:Fable 5 的网关花费占比从 13.2% 掉到 4.9%,Opus 5 涨到 22.5%——跑 Fable 的团队里十家里九家砍掉了用量。
走量-走钱分裂(volume-spend split) 「哪个模型跑最多 token」与「哪个模型花最多钱」之间的结构性落差。2026 年 8 月开源权重模型跑掉网关 56% 的 token,但只占约 14% 的花费;花费仍然集中在前沿模型上。
平均 token 价格(average token price) 按网关遥测中各家公布的列表价估算的「花费 ÷ token 量」。8 月环比降 23.2%、五个月腰斩——这个头条数字背后藏着走量/走钱分裂与档位决策,只看它会被误导。
最便宜的模型不是赢家——最贴任务的模型才是。Vercel 9 月《AI Gateway 生产指数》是第一份中立、公开的生产 AI 成本时序数据,它显示一个结构性分裂:2026 年 8 月开源权重模型跑掉网关 56% 的 token,却只占约 14% 的花费;用 Anthropic 最强模型的团队里十家里九家下移到低一档;平均 token 价格五个月腰斩。我们的判断:「平均 token 价格」是错误采购单位;决策单位是「每个任务的模型档位」——而真正该信的数字,是你自己在真实负载上测出来的。
2026 年 8 月,开源权重模型首次在 Vercel AI Gateway 上跑掉多数 token:占比从 2025 年 12 月的 7% 涨到 56%,八个月内超过所有闭源模型之和。但走量不等于走钱——前沿模型仍然拿走了多数花费,开源模型的花费占比在加速,却仍是少数;仅 Anthropic 一家,自去年 12 月起每个月都拿走网关至少 61% 的花费,8 月是 64%。来源:Vercel 官方报告。
这组数字说明的不是「开源便宜」,而是两个市场正在成形:走量的商品化层(开源权重)与走钱的质量溢价层(前沿模型)。对 C-suite 的意义很直接——「我们上了开源模型所以省了钱」这种叙事是错的:钱还在前沿那里。真正的问题是每个任务档位的支出是否配得上它的产出。
最干净的实证来自同一家实验室内部。7 月 1 日美国对 Fable 5 的出口管制解除、访问恢复,它的网关花费占比冲到 13.2%;同月底 Opus 5 上线。8 月,Fable 5 的花费占比掉到 4.9%,Opus 5 涨到 22.5%——跑 Fable 的团队里,十家里九家削减了用量,转向 Opus 5 的比转向其他任何模型都多。Vercel 的结论一句话:Fable 多出来的能力,不值双倍价格。
注意细节:负载下移了,钱没离开 Anthropic。因为团队去的是 Opus 5,不是别家。这印证了另一个规律——客户忠诚跟着「模型档位画像」走,不跟品牌走:新模型保住前一代的核心价值,客户就留下;保不住,需求就从别的供应商补上。
8 月平均 token 价格环比再降 23.2%,连续第三个月下降,是 4 月以来最陡的一次;五个月里腰斩。在「两个月份都跑超过一千万 token」的团队里,中位数团队每 token 花费再降 7.6%。对预算方,这是好趋势——同样预算能买更多推理,前沿模型只留给配得上溢价的档位。
但单个数字会误导。一是口径:花费按各家公布列表价估算,真实账单可能不同,报告本身注明口径会修订。二是平均数藏住结构:Google 的 token 份额从 30% 掉到 5%,其中 22 个百分点来自 Gemini 3 Flash 一个模型——它的负载一半流向更便宜的 GPT-5.6 Luna,另一半流向贵 3–9 倍的 Opus 5 和 Sonnet 5。平均价格没变,决策全变了。
「平均 token 价格」诱导出错误的决策:选最便宜的。但 9/10 团队的 Fable→Opus 下移证明,实际采购者早就在按任务优化——他们要的是「够好」,不是「最贵」也不是「最便宜」。成本控制从来不是选最便宜模型,而是选贴任务的档位:把前沿预算留给能证明溢价的负载,商品化负载交给开源权重,中间用质量闸门兜底。
我们的立场:把「平均 token 价格」从预算文件里删掉,换成「按档位的每个完成任务成本」。这不是笔法之争——56%/14% 的走量走钱分裂说明,声称「我们上了开源所以省钱」与「我们为每个任务选了正确档位」是两件完全不同的事,只有后者是真的成本控制。这也是我们自己跑的路:按任务档位路由,按完成任务计量,而不是按 token 计量。
Vercel 是最接近「中立观测位」的公开数据源之一,但它仍然是网关运营商,报告自己也写明:花费是列表价估算、实际账单不同、口径会修订、比较的是同批团队的相对移动而不是逐 token 追踪。这些 caveat 不是瑕疵——它们正是论点:厂商旁路遥测不是审计。
对 AI App lead:给每个任务档位装自己的成本 + 质量遥测,那是路由信号。对 CFO:把「平均 token 价格」当趋势指标读,别当预算线。真正可信的账单级数字,只能从自己的负载里量出来。
1. 列出你的任务档位
对话、RAG、agent 循环、批处理……每个档位配一个质量闸门,明确「够好」的判据。
2. 按档位测「每个完成任务的成本」
在真实流量上计量,不用列表价平均数;这是路由与预算的共同输入。
3. 每季度重审档位分配
Fable→Opus 的下移发生在一个月内;模型格局跑得比预算快,档位表必须跟着动。
行动:前沿预算只留给能证明溢价的负载;商品化量交给开源权重但必须过质量闸门;现在就在你的栈里建任务级成本遥测。留给买方的问题:如果把预算文件里每一处「平均 token 价格」换成「按档位的每个完成任务成本」,有没有任何决策会改变?如果不会,说明你还没有在按贴任务的方式采购。
OOMeta AI
OOMeta 的立场与实践:按任务档位路由、按完成任务计量成本,而不是按 token 计量——档位成本遥测是路由与预算的共同底座。Vercel 生产指数是最接近中立观测位的公开序列,但它的列表价口径正好说明:真正的成本审计只能来自你自己的负载。
预约诊断会参考来源: Vercel, AI Gateway Production Index — September 2026(花费按列表价估算、口径注明可修订)https://vercel.com/blog/ai-gateway-production-index-september-2026 | The New Stack 转引(开源走量/Anthropic 走钱)https://thenewstack.io/open-weight-anthropic-spend/
Vercel AI Gateway 截至 2026 年 8 月的生产遥测:开源权重模型跑掉 56% 的网关 token(2025 年 12 月时还只有 7%),但开源模型的花费占比仍是少数——仅 Anthropic 一家就占 64% 的花费。走量与走钱正在分成两个市场。
Opus 5 以约一半的价格上线后,跑 Fable 5 的团队里十家里九家削减用量,转向 Opus 5 的比转向其他任何模型都多。Vercel 的原话:多出来的能力不值双倍价格。但花费仍留在 Anthropic 阵营。
只能看方向。花费按公布列表价估算、实际账单可能不同、口径会修订——Vercel 自己在报告里说明了。用它读趋势(五个月腰斩),不要拿它审计你自己的账单。
5 月以来丢了 95% 的网关 token 份额;流失量超过四分之三流向其他实验室的模型——约一半转向更便宜的 GPT-5.6 Luna,大部分剩余转向更贵的 Opus 5 与 Sonnet 5。
OpenAI 的 GPT-6 Astra 上线两天内拿走 OpenAI 网关花费的三分之一,上线前十二天占全部网关花费的 7.7%——是同价 Fable 5.1(3.7%)的两倍。
别再按「平均 token 价格」横向比厂商。先定义自己栈里的任务档位,按档位测量「每个完成任务的成本」,用质量闸门把负载路由到能过闸的最便宜档位。
路由器不是买来的省钱:ACL’26 统一评测拆穿路由神话
LLMRouterBench(Findings@ACL’26,40 万+实例、33 模型、10 基线)统一评测:多数路由方法表现相近,商业路由器无法稳定击败简单基线(arXiv 2601.07206)。我们的判断:确定性任务→模型策略优于黑盒路由器,OOMeta 自家栈即如此运行。
开源权重智能体模型:先验证,别轻信厂商口径
Abacus.AI 09-10 发布 Smaug 系列开源权重智能体模型,声称长时 agent 循环提升 15-20%、成本低 10-100 倍(厂商口径,未独立验证)。我们的判断:开源权重让厂商声称第一次可以被买方自己验证——评估单位应从 token 价格变成「每个完成任务的成本」。
LLM 模型路由:推理成本降 40-80% 的真实条件
把每条请求路由到最便宜的可用模型,是 2026 年最大的成本杠杆:RouteNLP 试点降 58%、RouteLLM 基准降 85% 的背后,藏着三个条件——便宜模型占比过 50% 才复利、路由必须配评估闸门、闭环蒸馏比静态规则强一倍。
推理支出首次超过训练:企业 AI 采购从选模型变成买配置与切换权
Gartner:2026 年推理支出 233 亿美元首次超过训练 190 亿,agentic 工作流推理成本到 2028 年涨 5 倍以上。成本单位不是模型单价而是配置与放置——多数企业会从 neocloud/Token-as-a-Service 买 token 而非自托管。切换权才是 2026 年最该买的资产。