2026 年 9 月 · 7 分钟阅读

关键定义
Agent 效率比 ABC Legal 记账体系里,agent 交付的价值对照运行成本,每次运行以小时和美元上报。公司为每一个 agent 跟踪这个指标——就像基金经理给每个持仓单独记账的纪律。
Agent J 曲线 新 agent 通常会先「潜水」——用大模型、没有评估套件、烧 token 学任务,成本高于回报;随着团队写评估、换更便宜更快的模型、裁剪 token,曲线翻正。agent 是毕业出来的,不是一上线就盈利的。
Eval 门槛 agent 从「人在环内给建议」升级到「自主行动」必须跨过的阈值:在具体任务上证明自己与人类一样好或更好,判定依据是人在接受/拒绝建议时积累的标注数据集。毕业之后 agent 仍留在同一套测量框架里。
ABC Legal 那支 agent 舰队的标题数字,是它整个故事里最没意思的部分。一家约 1,100 人的法律文书送达公司,50+ 个 agent 上了生产、覆盖任务成本降约 50%——这是厂商自报的案例,有用,但不可迁移。可迁移的是记账:这家公司把 agent 当投资组合打理,给每个 agent 一个以小时和美元计的效率比,并且只让 agent 在通过 eval 门槛之后毕业为自主运行。那是大多数企业从不建立的缺失纪律。
ABC Legal 是美国法律文书送达公司(传票送达、电子立案、出庭律师业务)。把 Claude Enterprise 铺给 1,100 名员工后,公司各部门开始自发搭建自动化。随后公司部署 Claude Managed Agents:一套统一部署结构、共享工作区、单一审计与计费面、云上常驻 agent。截至 2026 年 7 月,公司自报:50+ 个 agent 投入生产;部分被 agent 覆盖的人工任务成本降约 50%(重度优化前);约 310 名员工跨部门日常使用 Claude(来源:Claude.com 案例,厂商自报 — https://claude.com/blog/how-abc-legal-turned-every-employee-into-a-builder-with-claude-managed-agents )。
agent 刻意做窄:每个有名字、有主人、只有一个活。案例里的例子:eFiling 驳回诊断器在法院驳回立案时自动触发,读案件详情、查法院规则、约一分钟把诊断贴进 Slack——这活儿以前要耗员工几个小时。一个案件核验 agent 逐个核对新案件与法院网站。一个应收汇款 agent 解析汇款邮件、生成 NetSuite 付款文件、发出来一键审批、再导入。一个叫 Charvis 的复核 agent 检查已完成的服务案件,现在约 98% 的时候与合规团队意见一致。
运营模式比任何一个 agent 都重要。大多数 agent 从人在环内开始:agent 看案件或工单、给出建议,人在任何动作发生前复核。建议要么存在案件里用横幅浮出,要么贴到 Slack 频道让人在帖子里回复。这些回应积累成一个好坏判断的标注数据集,喂给收割-调优循环,让团队能写评估、跨前沿模型给 agent 打分(来源:同一份 Claude.com 案例 — https://claude.com/blog/how-abc-legal-turned-every-employee-into-a-builder-with-claude-managed-agents )。
只有当 agent 在具体任务上证明与人类一样好或更好,才转入自主模式自己行动——之后仍留在同一套测量框架里盯着表现变化。这是毕业梯子,不是发射。人工审核闸门一鱼两吃:今天挡住坏动作,明天产出支撑自主权的标注数据。
最见真章的是记账。ABC Legal 为每个 agent 跟踪一个效率比:交付的价值对照运行成本,每次运行回传数据仓库,以小时和美元计。公司观察到 agent 走 J 曲线——新上线时常潜水,跑大模型,然后随着团队写评估、换更便宜更快的模型、裁剪 token 而翻正(来源:同一份 Claude.com 案例 — https://claude.com/blog/how-abc-legal-turned-every-employee-into-a-builder-with-claude-managed-agents )。
这句话值得读两遍,因为它同时反驳两个常见的企业假设。假设一:agent 两周不盈利就是失败项目。假设二:成本优化是项目阶段的事。ABC Legal 观察到的事实说两个都错:agent 是一个会按设计经历潜水期的头寸,把它翻正的杠杆——评估、更便宜的模型、裁剪 token——是持续运营动作。如果你没有每个 agent 的成本和价值数字,你连 J 曲线都看不见,更别说管理它。
案例里每一个数字都是厂商自报的:案例挂在 Claude.com——Anthropic 自家博客——~50% 成本下降和 310 个日常用户都没有独立审计。把这些数字当企业基准是范畴错误。但记账方法不属于任何厂商。梯子——建议、复核、标注、评估、自动化——和按 agent 计效率比,是任何公司用任何一家的栈都能实现的模式,也正是把「跑到 50 个生产 agent 的公司」和「跑 50 个试点公司的公司」分开的那个模式。
我们的判断:这是测量纪律论点最近最好的例证——企业 AI 里试点和生产之间的鸿沟不是模型差距,是测量差距。这家公司没有等一个完美模型;它建了产出标注数据的复核循环、决定毕业的 eval 门槛、让 J 曲线可见的按 agent 记账行。这与 OOMeta 从自己的 agent 基础设施工作中得到的结论一致:agent 部署里的差异化能力不是 agent,是围着它的那层测量。
第一,agent ROI 是测量纪律,不是案例——一个静态的「ROI 3.2 倍」数字,是一个必须持续运转的过程的滞后产物。第二,建议 → 标注数据 → eval 门槛 → 自动化这条梯子,是规模化部署 agent 的运营核心;自动化是毕业,不是发射。第三,J 曲线是正常的,而且只有靠按 agent 记成本与价值的账才可管理;没有它,团队要么过早杀掉 agent,要么让 agent 永远潜水。第四,买方尽调要问的是记账,不是展台:厂商怎么衡量每个 agent 的价值、标注数据集怎么建的、自主化前 eval 门槛要求什么?
第一,先写价值指标,再写 agent。对每个候选,定义「价值」在每次运行里是多少小时或美元——定义不了,你就不知道它是潜水还是盈利。第二,先把每个 agent 放在人工审核闸门后面。这个闸门不是合规复选框,它是让 eval 门槛成为可能的标注数据工厂。第三,显式地建 eval 门槛。agent 只有在你复核循环产出的数据集上、于具体任务中胜过人类时,才毕业为自主。第四,按 agent 记账,不按项目记账。每次运行自动上报效率比,J 曲线才可见、组合才可管理。
留给你的决策问题:如果你组织里每个 agent 都有每次运行上报的效率比,你会继续运行几个——又有几个今天就该杀掉?
OOMeta AI
OOMeta 构建 agent 舰队的测量层:按 agent 的效率记账、eval 门槛设计、把人工反馈变成标注数据的复核循环。我们帮企业把 agent 当投资组合运行,而不是当一次豪赌。
预约诊断会参考来源:ABC Legal 案例,Claude.com(厂商自报,2026)— https://claude.com/blog/how-abc-legal-turned-every-employee-into-a-builder-with-claude-managed-agents
ABC Legal 是一家约 1,100 人的美国法律文书送达公司,先铺开 Claude Enterprise,再部署 Claude Managed Agents。截至 2026 年 7 月,公司自报 50+ 个 agent 在产、约 310 名员工跨部门日常使用、部分被 agent 覆盖的人工任务成本降约 50%(重度优化前)。
没有。案例发布在 Claude.com——Anthropic 自家的博客——所以数字都是厂商自报。这正是可迁移的教训是记账方法(梯子与 J 曲线)而不是具体百分比的原因。
大多数 agent 从人在环内开始:agent 给建议,人接受或拒绝。这些回应积累成标注数据集,喂给调优循环。只有当 agent 在具体任务上证明与人类一样好或更好,才转入自主模式——并且之后仍留在同一套测量框架里。
因为新 agent 跑大模型、没有评估套件、烧 token 学任务。J 曲线翻正靠团队写评估、把 agent 换到更便宜更快的模型、裁剪 token。ABC Legal 用效率比为每个 agent 记小时和美元的账。
不要从「部署 agent」开始。从记账开始:给每个候选 agent 定义价值指标、先放在人工审核闸门后、积累标注数据集、只在 eval 门槛判定它胜过人类后才自动化。agent 舰队是投资组合,不是项目。
文档即策略:财务后办公室 AI 的共同骨架
Rivian 把采购应计自动化、Lemvigh-Müller 让超 90% 供应商确认免接触、丰田把设备诊断从 6 小时压到 3 分钟——三家用了同一套骨架。
800 个 Agent 不是故事:GE Appliances 的规模答案是数据平台
GE Appliances 披露已在制造、物流与供应链部署 800+ AI Agent。我们的判断:这个数字是滞后指标——真正让 800 个 Agent 成立的是统一工厂数据平台。
花旗 Arc 平台:最大规模实测的企业级 Agent 部署
花旗 4 月推出 Arc,把 AI Agent 当集中式操作系统:18 万员工用 AI、4 万开发者用 Devin 做 Agentic 编码、每周超 10 万 Agent 小时。