2026 年 9 月 · 6 分钟阅读

关键定义
token 卫生(token hygiene) 决定「每个业务结果烧多少 token」的一组工程习惯:prompt-cache 命中率、批量占比、重试纪律、上下文裁剪。价格战之后,这是账单的第一变量。
有效成本 vs 牌价 牌价是每百万 token 的标价;有效成本是完成一个业务结果实际花掉的钱 = 牌价 × 缓存折扣 × 批量折扣 × 重试系数。Blitzy 的案例里牌价没变,缓存纪律把成本打掉 87%。
价格战里最贵的其实是「你以为便宜」。OpenAI 在 2026-07-30 把 GPT-5.6 Luna 砍价 80%(约 $0.20/$1.20 每百万 token),Terra 降 20%;Anthropic 08-11 把 Sonnet 5 的 $2/$10 定为永久价,取消了原定 9 月 1 日的涨价。主流 API 的价格地板滑到约 $0.20/M 输入——当单价掉到这个量级,选哪个模型就不再是成本决策的第一变量,账单改由 token 卫生决定。
OpenAI 官宣(2026-07-30):GPT-5.6 Luna 降价 80%、Terra 降价 20%,并把 Luna 定位成「高吞吐多步工作流的成本解」(厂商口径)。Anthropic 08-11 将 Sonnet 5 的 $2/$10 定为永久价(平台文档口径)。按 CloudZero 2026-09-04 更新的对照:主流 API 地板在 $0.20/M 输入附近;OpenAI 自家产品线从 Luna 的 $0.20 到 GPT-5.5 Pro 的 $30 相差 150 倍,Anthropic 内部从 Haiku 的 $1 到 Fable 的 $10 相差 10 倍;输出普遍 5-6 倍于输入;缓存输入约按标准价 1 折计、批量约 5 折。
同一份 OpenAI 官宣页上,几个客户的自述数据更说明问题。Blitzy CTO:换到 Luna 后 prompt-cache 复用率从 24% 升到 90%,2.2 倍上下文、8.5 倍更少的输出 token,整体成本比 GPT-5.4 mini 低 87%。Dust CTO:同样的 agentic 任务,Luna 比原默认模型快 40%、便宜 40%。Notion:Terra 在个人 agent 上与 GPT-5.5 质量相当,每任务成本减半、时间省 60%。这些都是客户自述口径——但它们指向同一个结构:省下的钱主要不是降价给的。
agent 是 token 燃烧机:一次「完成一个任务」= 多轮工具调用 + 长上下文 + 可能的失败重试。真实成本 = 单价 × 缓存折扣 × 批量折扣 × 重试系数。价格战打下来的是乘法里最小的那个系数——单价。剩下的系数——缓存命中率、批量占比、重试率、上下文膨胀——才是账单的大头,而它们一个都没降价。
Blitzy 的 87% 是这句话的最佳注脚:牌价没变(模型换了),缓存与输出纪律把成本打掉 87%。厂商降价是分母的恩惠,token 卫生是分子的控制。CloudZero 2026 年对 260 位财务负责人的调查里,64% 说「能把 AI 花费与结果挂钩会改变我的投资方式」——这与我们的判断同向:预算者盯着牌价,真正该盯的是每任务有效成本。
我们自己的栈跑的是同一套逻辑:OOMeta 内部用 deepseek-v4-flash 处理高频批量、用更强模型做难任务、并做缓存与路由分层。价格战对我们是净收益,但账单结构没变——大头从来不是模型单价,而是每个结果烧了多少 token。这个观察在 2026 年上半年如此,价格战后依然如此。
① 把卫生指标接上可观测性
每个 agent 任务记录:缓存命中率、批量占比、重试率、每任务 token 数。没有这四个数,任何成本优化都是猜。
② 把缓存当架构决策
提示词模板化、稳定前缀、cache-friendly 的上下文编排——缓存命中率从 24% 到 90% 是架构选择,不是运气。
③ 给重试和工具调用上纪律
失败重试带退避与上限;工具调用链能剪枝就剪枝。无上限的重试是账单的隐形膨胀点。
④ 预算改用「每任务成本」
列出 top 10 业务任务,每任务的 token 消耗 × 有效单价。牌价只是乘法里最小的系数,别再拿它做预算。
衡量建议:月报里看两个数——「每任务平均成本」的环比,和「缓存命中率 × 批量占比」的乘积。前者是结果,后者是杠杆。两者都改善,说明你在控制分子;只有单价下降,说明你在等分母施舍。
OOMeta AI
OOMeta 内部就是一个多 agent 的 token 消费者:1 个人 + 多 agent 单元,每天的信号监控、内容生产、审计闭环都在烧 token。我们因此比多数咨询公司更早把「每任务有效成本」当第一指标——先量 token 卫生,再谈选型。这套方法同样用于客户的 agent 成本治理评估。
预约诊断会参考来源:OpenAI 官宣(2026-07-30,厂商口径;客户引用为自述)https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/ · Anthropic 平台定价(Sonnet 5 永久价,厂商口径)https://platform.claude.com/docs/en/about-claude/pricing · CloudZero LLM API 定价对照(2026-09-04 更新)https://www.cloudzero.com/blog/llm-api-pricing-comparison/ · CloudZero 2026 AI ROI 调查(260 位财务负责人,64%)https://www.cloudzero.com/finance-needs-ai-roi-2026-survey-report/
当主流 API 输入单价掉到 $0.20/M 量级,模型之间的价差不再决定账单。agent 的真实成本 = 单价 × 缓存命中率 × 批量占比 × 重试系数,后面这几个系数比单价大一个量级——所以决策变量从「哪个模型」变成了「每个结果烧多少 token」。
官方宣布 GPT-5.6 Luna 降价 80%(至约 $0.20/$1.20 每百万 token),Terra 降价 20%。Anthropic 随后在 08-11 把 Claude Sonnet 5 的 $2/$10 定为永久价,取消原定 9 月 1 日的涨价(均为厂商口径)。
Blitzy CTO 在 OpenAI 官宣页引述:换到 Luna 后 prompt-cache 复用率从 24% 升到 90%,2.2 倍上下文、8.5 倍更少的输出 token,整体比 GPT-5.4 mini 便宜 87%(客户自述口径)。——降价没这么大,省的是缓存与输出纪律。
四件事:① 提示词模板化与稳定前缀,最大化缓存命中;② 异步任务走批量 API(约 5 折);③ 失败重试带退避与上限,别让工具调用链无限膨胀;④ 上下文裁剪,别把整个历史塞进每个请求。
从「每百万 token 单价 × 预计用量」改成「每任务成本」:列出 top 10 业务任务,算清每个任务的实际 token 消耗 × 有效单价(含缓存与批量折扣)。牌价只是乘法里最小的那个系数。