2026 年 9 月 · 5 分钟阅读

关键定义
模型路由(LLM routing) 为每个请求从模型池中选择最合适模型的技术,目标是在质量与成本之间做最优权衡;2026 年已成为企业推理成本治理的标准动作。
简单基线(simple baseline) 不依赖逐请求学习的确定性策略,例如按任务类型固定选模型、或小模型优先加失败升级;LLMRouterBench 用它衡量路由器的真实增益。
Oracle 上界 理论上每次都能选中最优模型的路由上限,用于度量真实路由器与理想选择的差距;差距主要来自模型召回失败而非选择错误。
商业路由器承诺省 40% 到 80% 的推理成本,但直到今年,路由器之间的比较都没有一块公平的统一场地。ACL’26 的 LLMRouterBench 用 40 万+ 实例补上了这块场地——结论与厂商叙事相反:多数路由方法在统一评测下表现相近,若干新方法(包括商业路由器)无法稳定击败一条简单基线。省钱是真的,但钱不在路由器里。
LLMRouterBench(arXiv 2601.07206,Findings@ACL’26,代码与数据开源)构建了迄今最大的路由评测:40 万+ 实例、21 个数据集、33 个模型(旗舰到 7B 级轻量模型)、10 种代表性路由基线,同时给出面向性能与面向性能-成本权衡的两套指标,并支持延迟感知分析。论文的核心发现:①统一评测下多数路由方法表现相近——此前各家论文里的领先幅度,很大一部分来自评测场地的差异;②若干新方法——包括商业路由器——无法稳定击败简单基线(例如按任务类型固定选模型的确定性策略);③与 Oracle(每次都选中最优模型的理论上界)的差距,主要来自模型召回失败——不是选错了模型,而是候选池里根本没有能答对这道题的模型;④骨干 embedding 模型的影响有限;⑤更大模型集成的回报递减,精心挑选的小集合更优。
路由省钱的机制很简单:把低难度请求路由到便宜模型。这需要的是任务画像与确定性规则,不是黑盒评分器。企业大多数生产负载——客服摘要、文档抽取、RAG 回答、代码补全——难度分布高度集中:大部分请求落在「小模型足够」的区间。对这些负载,按任务类型加难度阈值做固定映射,就能捕获路由收益的大部分;这也是为什么论文里简单基线那么难被击败。
我们的判断:先做任务分级,再谈路由器。路由器(尤其是学习式路由器)的价值只在请求难度分布高度分散、且选择错误的代价可被量化时成立——多数企业到不了这个条件。
这不是纸上谈兵。OOMeta 自己的多模型栈就是确定性策略路由:主力 agent 单元固定使用 deepseek-v4-flash,特定分析子单元固定使用 gemini-3.5-flash——按单元与任务类型做固定映射,不跑学习式路由器。这与 LLMRouterBench 的结论一致:对固定的任务画像,确定性映射加私有域评估优于通用黑盒路由器,且可解释、可审计、零推理开销。
我们的判断:对大多数企业,路由策略应该是工程配置(谁、什么任务、走哪个模型、失败升级到谁),而不是一个需要持续训练与信任的封闭组件。
① 负载难度分布
把生产请求按任务类型×难度分层;如果大部分落在低难度层,规则策略就够。
② 声称的证据
供应商的省钱幅度有没有统一评测背书?有没有在你的私有域 eval 上跑过?
③ 换模型的成本
模型池每季度在变:路由策略维护成本 vs 路由器订阅加数据成本,谁更便宜?
④ 失败的代价
路由到错误模型(召回失败)的代价是否可量化?不可量化就不要上黑盒。
三十天动作:先别买路由器。花两周做任务画像——把生产请求按任务类型×难度分层,逐层测小模型基线(准确率加每完成任务的成本);如果规则策略已经覆盖大部分收益,路由器就不值得买。需要买时,要求供应商给出统一评测加你的私有域 eval 两组数字。
留给买家的决策问题:当商业路由器在 40 万实例的统一评测下打不过简单基线,你凭什么相信它在你的负载上省 40%?如果你的答案需要依赖对方提供的评测,那省下的钱还没到手,信任的账已经先欠下了。
OOMeta AI
OOMeta 的推理栈按同一原则运行:确定性策略路由,按任务类型固定映射模型,不用学习式路由器;每个模型选择都可解释、可审计。我们为客户做推理成本治理时,第一步永远是任务画像与基线,而不是采购路由器。
预约诊断会参考来源:LLMRouterBench(arXiv 2601.07206,Findings@ACL’26,2026-01-12 提交)https://arxiv.org/abs/2601.07206 · 论文全文与数据 https://arxiv.org/html/2601.07206v1 · 开源代码与评测数据 https://github.com/ynulihao/LLMRouterBench · 路由系统 2026 综述(交叉参考)https://www.digitalapplied.com/blog/llm-model-routing-2026-cost-quality-optimization-engineering-guide
2026 年发表于 ACL’26 Findings 的大规模模型路由统一评测:40 万+ 实例、21 个数据集、33 个模型、10 种路由基线,代码与数据开源(arXiv 2601.07206)。
多数路由方法在统一评测下表现相近;若干新方法——包括商业路由器——无法稳定击败简单基线;与 Oracle 的差距主要来自模型召回失败。
候选模型池里根本没有能答对该任务的模型——路由器选得再准也无济于事;这解释了为什么更聪明的路由算法收益有限。
确定性策略路由:主力 agent 单元固定用 deepseek-v4-flash,特定分析子单元固定用 gemini-3.5-flash,按任务类型固定映射,不用学习式路由器——与基准结论一致。
先做两周任务画像与基线:如果大部分请求落在低难度层,规则策略足够;买路由器前要求统一评测加私有域 eval 两组证据。
开源权重智能体模型:先验证,别轻信厂商口径
Abacus.AI 09-10 发布 Smaug 系列开源权重智能体模型,声称长时 agent 循环提升 15-20%、成本低 10-100 倍(厂商口径,未独立验证)。我们的判断:开源权重让厂商声称第一次可以被买方自己验证——评估单位应从 token 价格变成「每个完成任务的成本」。
推理支出首次超过训练:企业 AI 采购从选模型变成买配置与切换权
Gartner:2026 年推理支出 233 亿美元首次超过训练 190 亿,agentic 工作流推理成本到 2028 年涨 5 倍以上。成本单位不是模型单价而是配置与放置——多数企业会从 neocloud/Token-as-a-Service 买 token 而非自托管。切换权才是 2026 年最该买的资产。
agent 成本的第一控制变量是上下文:缓存命中率比 token 单价更真实
两份 2026 实测:提示缓存降 agent 成本 41-80%(arXiv 2601.06007),命中率 7%→84%、成本降 59%;keepalive 显示 Anthropic 5 分钟 TTL 下 4 分钟心跳最优。我们的判断:缓存命中率才是 agent 成本 KPI,上下文布局是唯一免费无损的降本杠杆。
token 价格战:单价不再是成本决策的第一变量
OpenAI 07-30 把 Luna 砍价 80% 至 $0.20/M 输入,Anthropic 08-11 把 Sonnet 5 的 $2/$10 定为永久价。我们的判断:价格战让「选哪个模型」失去意义,账单改由 token 卫生决定——缓存命中率、批量占比、重试与上下文膨胀。