2026 年 9 月 · 5 分钟阅读

关键定义
agent 技能(agent skill) 遵循 agentskills.io 开放标准的 SKILL.md 结构化 markdown:YAML frontmatter 声明触发条件与元数据,正文承载决策框架、参数表与验证标准。AWS 发布 38 个,覆盖 11 个医疗健康领域,MIT-0 开源。
渐进披露(progressive disclosure) 只激活与查询相关的技能内容,而不是一次加载全部:agent 在推理时按触发模式读取对应技能文本。这是「协调者 + 8 个领域专家(每专家约 15K token)」能替代「38 个技能全载约 80K token」的原因。
成对评测(pairwise evaluation) 把带技能的 agent 与同款不带技能的 agent 在 410 条提示上做头对头对比。带技能 agent 胜率 70–86%;批判性思维维度最强(78–85% 胜率,Cohen d = 0.65–1.03)。
当一个决策程序不可见,它就不可治理。AWS 刚发布了 38 个面向医疗健康(HCLS)的开源 agent 技能,把领域决策程序编码成纯 markdown——带 YAML 触发条件的 SKILL.md 文件,成对评测显示 70–86% 胜率。我们的判断:策略即文本 = 受监管 AI 的审计桥——当程序活在文本文件里,合规评审变成 diff 评审,政策变化变成一次部署而不是一次重训。这是 OOMeta 内部就在跑的同一架构。这篇讲清楚技能是什么、数字到底说明什么、以及对受监管买方意味着什么。
让一个 agent 按 ACMG/AMP 标准解读 TP53 错义变异:它会引用正确的框架,却误用证据类别、跳过群体频率阈值、编造计算预测分数。模型知道事实,但缺少领域从业者多年内化的结构化推理程序。这个缺口在变异解读、理赔审核、临床试验设计与影像分析里制造「静默失败」——输出看起来正确,实际套错了标准,直接对应监管与患者安全后果。来源:AWS ML 博客。
技能分两类:推理技能编码方法论与决策框架(genomic-variant-interpretation 承载完整 ACMG/AMP 分类);流水线技能承载工具命令与验证参数(variant-calling 提供 GATK4 HaplotypeCaller 命令、VQSR tranche 灵敏度目标、Mutect2 肿瘤-正常配置)。与 RAG 不同——RAG 检索片段增强生成;技能编码的是决策程序与错误条件本身。与微调不同——它是按触发模式上下文激活的结构化提示。
三个属性构成区别:可审计——每个决策标准都是 markdown 里人可读的文本,不藏在模型权重里;可移植——同一份技能在 20+ 服务上免定制运行(Bedrock AgentCore、Strands、Claude Code、Codex 等);可维护——年度医疗政策变化改一个文本文件即可,不用重训。对受监管买方,前两条正是监管审查要的东西。
410 条提示的成对评测:带技能 agent 对同款无技能 agent 的头对头胜率 70–86%,随 harness 配置变化;最强效应在批判性思维(78–85% 胜率,Cohen d = 0.65–1.03);在最难的查询上提升最大——正是无引导 agent 失败最多的地方。口径注意:这是 AWS 自发布评测,胜率随 harness 浮动;但评测框架本身开源,你可以在自己的提示集上重跑。
把 38 个技能全部载入单个 agent 上下文约 80K token——大上下文模型跑得动,但每次查询都要从 38 个里选子集,无关技能内容还在抢注意力。Kiro 的多 agent 方案:轻量协调者(不载技能)把查询路由给 8 个领域专家,每个专家只载相关技能(约 15K token/专家)。协调者管意图分类,专家管领域推理。
这是舰队级的渐进披露:路由层保持瘦,领域程序按需加载。对任何搭多 agent 的团队,这条直接可抄——先问「每个 agent 真正需要多少上下文」,再问「需要哪个模型」。
决策程序就是合规工件。当它是一份文本文件时:审计员读的是 diff,不是权重;评审者能读到你 agent 实际套用的每一条标准;政策更新是一次部署(改文件 + 重跑评测),而不是一次重训。「可审计、可移植、可维护」不是工程洁癖,正是监管者关心的合规属性本身。
我们不是在评论别人的架构——OOMeta 内部跑的就是同一套:SKILL.md + 触发路由 + 渐进披露,技能就是我们产品表面的承载方式。所以对这个模式我们是 dogfood 的。给受监管买方的结论:问题不是「用哪个模型」,而是「决策程序住在哪里」——如果住在权重里,你无法评审它。
行动:挑一个高频决策工作流;克隆相关技能(或自己写 SKILL.md);把阈值改成你的规程;用自带成对评测框架在你团队的真实提示上跑;胜率过线再上线。留给买方的问题:你的合规评审能读到 agent 实际遵循的完整程序吗——以文本形式?读不到,你的审计桥还不存在。
OOMeta AI
OOMeta 的立场与实践:决策程序就是合规工件,策略即文本就是审计桥——评审变成 diff 评审,政策变化变成部署而不是重训。OOMeta 内部跑的就是 SKILL.md + 渐进披露架构,对受监管买家,问题不是「用哪个模型」,而是「决策程序住在哪里」。
预约诊断会参考来源: AWS ML Blog, Improving HCLS AI reasoning with open-source agent skills(厂商自发布评测)https://aws.amazon.com/blogs/machine-learning/improving-hcls-ai-reasoning-with-open-source-agent-skills/ | GitHub, awslabs/hcls-agent-skills(MIT-0)https://github.com/awslabs/hcls-agent-skills | Agent Skills 开放标准 https://agentskills.io
基础模型能引用指南(如 ACMG/AMP 变异解读),却会误用证据类别、跳过群体频率阈值、编造计算预测分数。技能通过把决策程序与错误条件写成可读文本弥合这个缺口——不是检索段落(RAG),也不是重训。
YAML frontmatter(触发条件、依赖、元数据)+ 决策框架、阈值表、常见错误清单、代码模式与验证标准。genomic-variant-interpretation 技能把完整 ACMG/AMP 分类框架(证据类别、群体频率阈值、计算预测器截断值)写进文本。
在 410 条提示上,带技能 agent 对同款不带技能 agent 的成对胜率 70–86%;最强者在批判性思维(78–85% 胜率,d = 0.65–1.03),且在最难的查询上提升最大——正是无技能 agent 失败最多的地方。
作为文本编辑处理。医疗政策变更或新实验标准,改 SKILL.md 文件即可,不用重训模型——这正是技能在受监管垂直领域「可审计、可维护」的来源。
都不是。RAG 检索片段增强生成;技能按触发模式上下文激活、编码的是决策程序本身。且技能可移植——同一份技能能在 20+ 服务上跑,从 Bedrock AgentCore、Strands 到 Claude Code 与 Codex。
克隆仓库,复制相关 SKILL.md,把决策阈值改成自己的规程,再用自带评测框架在你自己的工作流提示上跑成对评测,胜率过线再上线。(完全披露:OOMeta 内部跑的就是同一套 SKILL.md + 渐进披露架构。)
从试点到 6,000 人:评估必须变成发布闸门
Sabadell Seguros 把 SofIA 推给 6,000 名销售代理前,先回答「ready 是什么」:自动生成测试集、按业务校准的裁判、评估接进每次发布。一次回归测试在 6,000 人之前拦下模型切换引发的可靠性劣化。我们的判断:规模化瓶颈不是 agent 质量,是验证节奏。
采购 agent 的价值有顺序:BCG 调研 200+ 高管,内部效率先于商业结果
BCG 2026 调研 200+ 采购与技术高管:agentic AI 内部运营价值(速度/吞吐/减少手工)先于外部商业价值(谈判、许可、供应商质量);生产优于试点,技术+流程重组+治理优于纯技术。我们的判断:价值顺序是部署纪律——KPI 阶梯按阶段设计,别用第一年商业结果杀死内部已兑现的项目。
我们自己就是第一个客户——OOMeta 如何用 AI 运营公司
我们自己就是第一个客户:1 个人类创始人 + 5 个 AI 数字团队 + 1 个 CEO agent,每天协作运营一家真实公司。本文复盘数据流如何把信号变成行动,以及效率、覆盖面、一致性的实际结果。
公共榜单测不出私有代码:Real-SWE 揭示编码 agent 的真实水位
首个用私有生产代码评测编码 agent 的基准(2026-09):最强组合 Fable 5.1 解决率仅 38.8%,短任务失败率 71.4%≈长任务 73.4%,99% 企业 token 对模型不可见。我们的判断:公共榜单是选型幻觉,私有域 eval 才是唯一可信信号。