2026 年 9 月 · 8 分钟阅读

关键定义
Agent 技能(Agent Skill) 满足四项判据的结构化能力包:包含程序性内容、含可执行代码模板或资源、提供验证逻辑、可在推理期加载而不改动模型权重。按 SkillsBench 口径,系统提示词、少样本示例、RAG 检索内容与工具文档都不属于技能。
归一化增益(Normalized Gain) 把技能带来的绝对提升除以剩余可提升空间(1 减去无技能通过率)得到的指标,用于避免基线高的模型看起来提升幅度小。SkillsBench 中人工策划技能的平均归一化增益为 21.5%,自生成技能为负值。
Harness(执行框架) 包裹模型的整套系统——系统提示词、工具调用、文件系统、沙箱、编排逻辑与反馈回路。SkillsBench 使用三个商业 harness:Claude Code、Codex CLI、Gemini CLI;同一模型换 harness 的通过率差异可达二十个百分点量级。
给 agent 加技能,最不值得加的地方是写代码——那里模型已经会了;最值得加的地方是你自己的行业流程——那里模型永远不会自己会。SkillsBench 用 84 个任务、7 个模型-harness 组合、7,308 条轨迹,第一次把「技能」当成可测量的独立变量:人工策划的技能平均带来 16.2 个百分点的通过率提升,但这个收益在领域之间差了十倍以上——医疗 +51.9pp,软件工程只有 +4.5pp;而让模型自己生成技能,平均收益接近于零甚至为负。我们的判断:agent 能力预算的记账单位应该是「领域程序性知识资产」,不是模型升级。
SkillsBench(arXiv 2602.12670)把技能定义为包含指令、代码模板、资源与验证逻辑的结构化包,并明确把系统提示词、少样本示例、RAG 检索内容、工具文档排除在技能之外。这个定义比结论更重要:它把技能从提示工程里切出来,变成可版本化、可评审、可复用的资产。
方法上,每个任务在三种条件下各跑一遍——不给技能、给人工策划技能、给模型自生成技能;三个商业 harness(Claude Code、Codex CLI、Gemini CLI)配七个前沿模型,每个任务五次试验,共 7,308 条轨迹,用确定性的 pytest 判定成败。这是目前少见的、把「技能」当作控制变量的公开测量。全文:arxiv.org/html/2602.12670v1。
结果:不给技能的平均通过率 24.3%,给人工策划技能 40.6%,整体失败率从 78.4% 降到 61.1%。技能确实有效——但接下来两个发现才是买方该看的部分。
按领域拆开,收益差了十倍以上:医疗 34.2% 到 86.1%(+51.9pp)、制造 1.0% 到 42.9%(+41.9pp)、网络安全 +23.2pp;而数学 41.3% 到 47.3%(+6.0pp)、软件工程 34.4% 到 38.9%(+4.5pp)。
论文给的机制解释很直接:收益最大的领域是预训练覆盖薄、需要专门程序性知识的领域,例如临床数据标准化、制造排产优化;而软件工程与数学这类在公开语料里密度极高的领域,模型已经把操作规程内化了,技能只能提供边缘改进。
我们的判断:这个分布对预算分配的含义是反直觉的。如果你把技能预算花在通用编码 agent 的提示优化上,你是在给一个已经会做这件事的模型补课;同样的钱花在你自己行业流程上,回报可以差一个数量级。技能不是增强模型的通用插件,而是补预训练空缺的专用件。
第二个发现更值得警惕:让模型自生成技能,平均收益接近于零甚至为负——整体失败率 80.9%,比不给技能的 78.4% 还差。分组合看:Claude Code 加 Opus 4.5 自生成 21.6% 对不给技能 22.0%;Codex CLI 加 GPT-5.2 是 25.0% 对 30.6%,低 8.1 个百分点;Claude Code 加 Haiku 4.5 持平在 11.0%。
论文的结论可以一句话概括:模型无法可靠地撰写它自己受益于消费的程序性知识。这推翻了一个流行假设——agent 可以自我改进技能库。模型能写代码,但写不出比自己更好的操作规程,因为它缺的正是那份没有被写进公开语料的领域经验。
我们的判断:这是治理问题,不是技术问题。技能库必须走人工评审流程——谁写、谁批准、谁退役,都要有名字。让自生成技能直接进生产环境,等于把「模型不知道自己不知道什么」这个缺陷制度化。
同一批技能在不同 harness 上的表现差异同样大。Claude Code 的技能利用率最高,提升幅度从 +13.9pp(Opus 4.6)到 +23.3pp(Opus 4.5);Gemini CLI 原始分最高(Gemini 3 Flash 48.7%),提升 +13.6pp 到 +17.4pp。Codex CLI 的失效模式最值得记录:它经常忽略提供的技能——agent 承认技能内容存在,但往往自己另写一套实现。技能被读到了,没有被执行。
同一模型换 harness 的绝对分差可以到二十个百分点量级,这比大多数模型升级带来的差距更大。所以「我们买了最好的模型」不是一个可交付的能力声明;能被采购和验收的单位是「模型 + harness + 技能库」的组合。
数量上,2 到 3 个技能收益最大(+18.6pp),1 个技能 +17.8pp,4 个以上掉到 +5.9pp;篇幅上,中等长度的技能优于全面详尽的文档。技能数量和篇幅都是负债:每多一份技能,就多一份上下文预算、冲突概率和维护成本。
边界同样清楚:16 个任务(84 个中的 19%)在全部 7 个组合、三种条件下通过率都是 0%。技能救不了能力前沿之外的任务。还有一个成本侧的观察:Gemini 3 Flash 每任务输入 token 是 Gemini 3 Pro 的 2.3 倍(1.08M 对 0.47M),用迭代探索替代推理深度,但按官方定价每任务成本反而低约 44%(0.55 美元对 0.98 美元)。小模型加技能可以越过更大模型的无技能基线——这是「技能换模型档位」的直接证据。
我们的判断:agent 能力投资的第一性问题不是换哪个模型,而是我们自己的程序性知识有没有被写成资产。技能是这个资产的一种可测量形态——它的回报取决于领域稀缺性、取决于是否人工策划、取决于是否被 harness 真正执行。
先测自己的基线
在你的真实任务上跑不给技能的基线,再加候选技能重测。通用排行榜的领域结构和你的负载不同,参考价值有限。
预算投向预训练覆盖薄的地方
你的行业流程、内部系统、合规判据、专有数据结构;通用编码与数学优化的优先级最低。
技能库走代码评审
每份技能有作者、批准人、退役条件;禁止自生成技能未经评审进入生产。
保持 2 到 3 份、中等篇幅
技能数量是上下文负债,不是资产。
验收单位是组合
换 harness 或换模型档位都要重测技能有效性,不要把模型升级当成能力升级。
行动:这一周就能做的最小动作——挑一个你们反复失败的行业任务,把资深同事脑子里的操作规程写成一份技能,然后跑 A/B 对比。留给买方的问题:你的 agent 能力预算里,花在模型升级和写清自己流程上的比例是多少?如果严重偏向模型,你买到的是别人也能买到的东西。
OOMeta AI
agent 能力不是从模型能力里长出来的,是从被写下来的程序性知识里长出来的。我们把技能当资产管理——人工策划、代码评审、按领域稀缺性配置预算、按「模型 + harness」组合验收,而不是按排行榜买模型。
预约诊断会参考来源: SkillsBench: A Benchmark for Evaluating Agent Skills(arXiv 2602.12670;84 个任务、11 个领域、7 个模型-harness 组合、每任务 5 次试验共 7,308 条轨迹,确定性 pytest 判定)arxiv.org/abs/2602.12670 | 全文 arxiv.org/html/2602.12670v1。本文引用的全部数字均来自该论文正文与其表格。
按 SkillsBench 的四项判据,技能是包含程序性指令、可执行资源与验证逻辑的结构化包,可在推理期加载而不改模型权重;系统提示词、少样本示例、RAG 检索内容和工具文档都不算技能。这个切分让技能变成可版本化、可评审、可复用的资产。
人工策划技能把平均通过率从 24.3% 提到 40.6%(+16.2pp),整体失败率从 78.4% 降到 61.1%;但领域差异极大,医疗 +51.9pp、制造 +41.9pp,而软件工程只有 +4.5pp、数学 +6.0pp。
不能。自生成技能平均收益接近于零甚至为负,整体失败率 80.9%,比不给技能的 78.4% 更差;Codex CLI 加 GPT-5.2 上自生成技能 25.0% 对不给技能 30.6%,反而低 8.1 个百分点。论文结论是模型无法可靠撰写自己受益于消费的程序性知识。
不是。2 到 3 个技能收益最大(+18.6pp),1 个技能 +17.8pp,4 个以上掉到 +5.9pp;中等篇幅优于全面详尽。技能数量和篇幅都是上下文负债,不是资产。
同一批技能在不同 harness 上表现差异显著:Claude Code 提升 +13.9pp 到 +23.3pp,Gemini CLI 提升 +13.6pp 到 +17.4pp,而 Codex CLI 经常忽略技能内容、自行另写实现。换 harness 带来的差距大于多数模型升级。
不能。84 个任务里有 16 个(19%)在全部 7 个模型-harness 组合、三种条件下通过率都是 0%,属于当前能力前沿之外;技能只是把前沿往上推,不是万能钥匙。
验证类失败在各模型失败中占比 48% 到 53%,是首要瓶颈——问题在质量而非结构。技能主要减少的正是验证失败,质量不达标案例从 1,184 个降到 819 个,减少 30.8%。
Uber 四个月烧完全年 AI 预算:编码 agent 的成本失控是治理问题
Claude Code 采用率从 32% 涨到 84%,约 70% 的提交代码由 AI 生成,2026 全年 AI 预算在 4 月耗尽,人均成本 $150–$2,000/月,内部排行榜把 token 消费变成竞赛。我们的判断:失败模式不是拒绝采用,而是无治理的拥抱——用量计费需要 DevOps 级成本控制。
政策写进文本,不写进权重:agent 技能是审计桥
AWS 发布 38 个开源医疗 agent 技能:决策程序以 SKILL.md 文本承载,年度政策变化改文件、不重训;成对评测显示技能 agent 胜率 70–86%。我们的判断:策略即文本 = 受监管行业的审计桥,评审变成 diff 评审。OOMeta 跑的就是同一架构。
从试点到 6,000 人:评估必须变成发布闸门
Sabadell Seguros 把 SofIA 推给 6,000 名销售代理前,先回答「ready 是什么」:自动生成测试集、按业务校准的裁判、评估接进每次发布。一次回归测试在 6,000 人之前拦下模型切换引发的可靠性劣化。我们的判断:规模化瓶颈不是 agent 质量,是验证节奏。
采购 agent 的价值有顺序:BCG 调研 200+ 高管,内部效率先于商业结果
BCG 2026 调研 200+ 采购与技术高管:agentic AI 内部运营价值(速度/吞吐/减少手工)先于外部商业价值(谈判、许可、供应商质量);生产优于试点,技术+流程重组+治理优于纯技术。我们的判断:价值顺序是部署纪律——KPI 阶梯按阶段设计,别用第一年商业结果杀死内部已兑现的项目。