2026 年 9 月 · 5 分钟阅读

关键定义
Agent harness(agent 运行时) 让 agent 能长时间可靠工作的工程层:会话管理、上下文压缩、工具编排、子 agent 协调、失败恢复。过去企业要自己搭;OpenAI 2026-09-10 起把它作为托管 API(Agents API)提供。
边界(boundary) agent 与外部世界之间的接口与控制面:它能调用的工具、被授予的权限、以及留下的证据。harness 商品化后,企业的差异点与风险集中在这里。
过去一年,企业把大笔工程预算花在自建 agent 运行时上——会话管理、上下文压缩、子 agent 编排、失败恢复,每个团队都在重复造同一个循环。2026-09-10 开始,这个默认答案变了:OpenAI 把驱动 Codex 的同一套 harness 打包成托管 API(Agents API)公开测试,且无额外费用。当模型厂商接管「循环」,你省下的不只是工程时间——你的差异化从「怎么写 loop」转移到「loop 之外的东西」:工具、权限、证据。
OpenAI 2026-09-10 的官方公告给出四个核心概念:agent、environment、session、events。托管 harness 负责自动上下文压缩(session 接近上限时保留关键信息)、工具搜索(按需加载工具定义、省 token)、程序化工具调用(并行执行、链式操作)、以及多 agent 编排(主 agent 拆解任务、子 agent 并行工作、各自维护独立上下文)——这些都是过去团队自建 loop 时最花时间的部分(OpenAI 公告,来源见文末)。
沙箱是开放的:官方口径允许三种选择——OpenAI 托管沙箱(与 Codex 和 ChatGPT 同一套基础设施)、你自己的基础设施、或伙伴沙箱(Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel)。定价上官方明确「无额外费用」:只按 token、工具与沙箱计算付费。另外,harness 本身基于开源 Codex harness,开发者可以 inspect 核心逻辑——可见,但运行由厂商负责。
公告中引用的客户数据需要标注性质:Ciridae 称评估分从 0.71 升到 0.85、子 agent 延迟降 4 倍;SafetyKit 称迁移后每案例成本降 60%;Hypha 称把 harness 与沙箱分离后失败响应降 86%;Nash 称数千个长时 agent 管理数亿次配送——均为厂商公告中的客户/合作伙伴陈述,未经独立验证,只能作为方向性证据。
当循环由厂商运行,企业的差异化与风险都转移到三层边界。第一层是工具与知识:你的 MCP server、技能、私有数据——这是「你拥有而 OpenAI 没有」的部分。第二层是权限与身份:谁授权 agent 做什么、能碰什么——托管 harness 不会替你定义企业内的授权模型。第三层是证据:agent 做了什么、为什么——OpenAI 提供 events 与日志,但「这条记录不可被 agent 篡改、可被审计接受」是企业自己的事。可核验的证据不能存放在被监督对象自己手里——这是 OOMeta 自己 agent 运行时的设计原则(执行进沙箱、证据留在沙箱外),在本事件里直接可迁移:无论谁运行循环,证据链的归属必须是企业自己。
战略含义是明确的:自建 harness 的 ROI 开始坍缩。除非你有 OpenAI 不提供的边界需求——数据驻留、监管级证据链、深度定制的工具或权限模型——否则自建只是在为商品付研发税。这不代表所有 agent 基础设施都会消失;它意味着基础设施的价值重心从「循环本身」上移到「循环外面那一圈」。
① 数据边界:哪些工作流的数据不能离开你的环境?
能离开的交给托管沙箱;不能离开的用自托管或伙伴沙箱(VPC 部署)。先圈边界,再谈 harness——边界决定架构,架构决定选择。
② 证据要求:监管或审计需要什么级别的可核验证据?
只要需要「不可篡改、可回放、可追溯」的记录,证据层就必须独立于厂商事件日志——无论用托管还是自建 harness。
③ 工具深度:你的 MCP 与技能资产能否无缝接入?
托管 harness 支持 MCP、自定义函数与内置工具。资产越厚,迁移成本越低;资产为零,托管优势越大。
④ 锁定成本:迁移路径清楚吗?
开源 Codex harness 意味着你能 inspect 逻辑,但运行服务本身是厂商拥有。把「换供应商的迁移成本」写进决策,别只看第一年账单。
不要用架构信仰决定 build or buy。挑一个低风险、每周重复的工作流(文档更新、工单分诊、数据核对),分别用自建 loop 与 Agents API 各跑一周,记录三个数:任务完成率、每完成任务的成本、失败后的恢复时间。完成率与恢复时间接近,说明 harness 已经商品化——你的自建成本是纯开销;差距明显,说明你还有别人没解决的边界问题,自建仍有理由。
留给买家的决策问题:如果 harness 是商品,你还在为哪部分自建买单?回答不出来,那一周对照实验会替你把答案算出来。
OOMeta AI
OOMeta 的 agent 运行时把执行放进沙箱、证据记录放在 agent 无法修改的位置——因为可核验的证据不能存放在被监督对象自己手里。这个原则在本事件里直接可迁移:无论谁运行循环(OpenAI、伙伴沙箱或自托管),证据链的归属必须是企业自己。我们为客户评估 agent 架构时,第一问从来不是「用哪家模型」,而是「你的证据层在哪里、谁拥有它」。
预约诊断会参考来源:OpenAI 官方公告《Introducing the Agents API》(2026-09-10,厂商口径)https://openai.com/index/introducing-the-agents-api/ · AI Agents News 周报(2026-09-14,补充背景与多方事件梳理)https://aiagentstore.ai/ai-agent-news/this-week
2026-09-10 进入公开测试(public beta)。它把驱动 Codex 的同一套 harness——会话、编排、上下文压缩、恢复——变成托管 API,开发者用一个 API 调用就能创建生产级 agent(OpenAI 官方公告)。
官方口径:没有额外的 Agents API 费用,只按模型 token、工具使用和沙箱计算付费。这是「无加价商品化」的关键信号——harness 本身不再被单独定价。
可以。沙箱有三种选择:OpenAI 托管、你自己的基础设施、或伙伴沙箱(Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel)。数据驻留要求高的工作流可以用自托管或伙伴环境——这是选择托管 harness 时最需要先确认的边界。
这些数字来自 OpenAI 公告中引用的客户/合作伙伴陈述(Hypha 分离 harness 与沙箱后失败响应降 86%;SafetyKit 迁移后每案例成本降 60%),未经独立验证,应视为客户声称而非既成事实。它们只能说明模式可行,不能作为采购依据。
取决于你的边界需求:数据驻留、监管级证据链、深度定制的工具与权限模型。没有这些需求的工作流,自建运行时的 ROI 开始坍缩——你在为「大家都在商品化的部分」付自建成本。先做边界盘点,再决定 build or buy。
Agent 正在变成软件功能:40% 企业应用内嵌 agent 改变了采购决策
Gartner:2026 年底 40% 企业应用将内嵌任务型 agent(2025 年 <5%);2026 年中约 80% 应用已嵌入、仅 31% 企业在生产运行 agent。我们的判断:嵌入容易、运营难——先盘点你已拥有的 agent,再决定买什么平台。
记忆层成了新品类:治理只锁了一半的门
Writer 09-09 发布 Enterprise Brain:治理化的共享上下文层,agent 产出前必读、完成后回写。记忆治理至此成为产品类别——但第一代只回答了「谁能读」,没回答「agent 写回的内容谁审计、读完做了什么由谁独立证明」。
AI Agent 可观测性:2026年生产部署的关键瓶颈
AI Agent 可观测性正在成为企业部署AI Agent的核心瓶颈。追踪每一步、评估质量而非仅看可用性、控制观测成本——本文基于Gartner、McKinsey等行业研究,提供完整的可观测性最佳实践指南。
企业 AI 市场 2026 年达 $1148.7 亿——年增长 18.91%,治理成为最大赛道
Mordor Intelligence 报告显示 2026 年全球企业 AI 市场规模达 $1148.7 亿,18.91% CAGR 增长至 2031 年 $2730.8 亿。软件平台占 65.89% 收入,硬件加速器增长 19.39%。亚太地区增速最快。