2026 年 9 月 · 7 分钟阅读

关键定义
组织级第二大脑(Organizational Second Brain) 一种 AI Agent 架构:把专家的隐性知识预先提炼成结构化、可审计的知识文件,作为组织对领域的解读基准,而不是在每次推理时从原始文档重新推导。
Recipes(配方/组合式流程) Meta 用来编码专家方法论的程序式流程:规定先检查什么、每一步加载哪些知识、遵循什么决策程序、怎样算完成分析。知识文件是陈述式的,recipes 是指令式的,两者分离。
9 月 2 日,Meta 工程博客发布了一个值得企业 AI 团队反复读的架构:一个领域专家 Agent,通过『结构化知识文件 + 组合式 recipes + 自改进编译回路』,把专家的隐性知识变成可审计、可回归测试、可持续进化的组织记忆——全程不重训模型。
大型组织面临同一个困境:一部分专业知识被写成了模型、剧本、清单和框架,但最有价值的部分活在专家脑子里,很少被持久化。在合规领域,同类问题会在数百个产品评审中反复出现,专家评估要花数天手工研究,评估之间的不一致还产生真实组织风险。
更常见的情况是:专家花在回答常规问题上的时间,比花在真正新颖、模糊的判断上的时间还多。Meta 的答案是造一个系统,让专家推理的方式被捕获,让需要的人都能访问——而不是把文档堆在那里让 Agent 每次重新推导。
系统分四层,每层解决一个独立问题,且互相依赖:知识系统的文件结构让自动化编辑成为可能;推理层的显式程序让失败归因可追踪;评估框架为每次变更把关;改进回路反过来喂养知识与推理两层。去掉任何一层,其它层都会退化。
核心设计判断是把『知道的』与『怎么推理的』分开:知识文件是陈述式的、不含程序;recipes 是指令式的、不含领域事实。于是——新增一个组织立场 = 加一个知识文件 + 更新路由索引,recipes 不动;修一个方法缺陷 = 改一个 recipe,知识文件不动。失败也能干净地归因到某一层:是知识错了,还是程序错了。
Meta 把隐式知识预先显式化:一个长期运行的离线过程通读源文档,蒸馏成结构化知识文件。组织里 200+ 个文件按严格分类学组织——Position 文件记录组织的权威立场与约束边界;Taxonomy 文件维护统一术语作为单一事实源;Routing 索引把输入特征映射到相关文件,让检索确定且可审计;Gateway 文件设置进入分析领域的门槛测试。
每个文件的 YAML frontmatter 声明依赖(depends_on)与消费者(referenced_by),形成双向依赖图。一个文件变更,能精确追踪哪些文件受影响——这对自改进回路提议自动化编辑至关重要。行业里 Karpathy 的 LLM Wiki 与 Google 的 Open Knowledge Format 殊途同归:知识应该被预提取、显式结构化、渐进披露,而不是每次查询重新推导。
Recipe 的另一个收益是渐进披露。早期版本用一个扁平指令文件 + 语义搜索加载全部来源,每个查询都把大量混合相关性文件拉进上下文。重构为 recipe 驱动的分阶段流程后,每个查询只接触小而精准的子集,每轮消耗的 token 降低约 80%。上下文窗口有限、注意力随体积衰减——在对的时间给对的指令,直接提升推理质量。
这是整个系统最独特的部分。相互依赖的文件让手工维护无法规模化——专家反馈要翻译成精确的文件编辑,过程可能耗时数周,还要理解完整依赖图、验证不破坏任何东西。Meta 把它当作编译问题自动化:诊断(把反馈归因到根因)→ 编译(子 Agent 并行分析影响、产出最小编辑,独立对抗式评审找出矛盾)→ 验证(定向回放 + 回归测试,判定器与被测 Agent 互不知情,防止确认偏差)→ 专家评审。
回路落地后,原始失败场景与其验证过的正确回答自动加入回归套件——每个修复永久抬高门槛,未来任何改动都必须保持刚被纠正的行为。输出是带完整审计轨迹的 PR(diff),人类专家评审的是已被证明的修复,而不是调试原始失败。
六周、三个开发冲刺后:领域专家几乎总是认为输出有用(早期版本经常需要大量返工);单个评估时间从数天降到数分钟;自动化自改进以此前需要完整工程冲刺的速度产出验证过的知识编辑;整个改进周期零回归。专家报告 Agent 处理了绝大部分分析工作,让他们专注真正需要人类判断的模糊案例。
这套架构是领域无关的,适用条件是:专家知识以部落知识的形式活在少数人脑子里、评估一致性很重要、工作量超过专家容量、通用 LLM 产出不足。明确的候选领域包括监管合规、协议遵从、金融风险评估、安全评审、工程标准遵从与采购评估。
这条路径的深层原则是:把复杂性留在人和 Agent 都能读的文本文件里,而不是微调进模型权重。每个改进都是专家 30 秒能评审的文本编辑,每个变更都可版本控制、可 diff、可回滚。对正在建设企业知识系统的团队,可复制的四要素是:带显式文件边界与依赖图的结构化知识系统、把知识与方法论分离的程序层、随改进循环增长的评价套件、按风险容忍度校准的人工检查点。模型不重训、知识持续进化——这是『专家努力永久复利』的可落地版本。
参考来源
专家知识大多活在人的脑子里,没有被持久化。同类问题在数百个产品评审中反复出现、专家评估要花数天人工研究、评估之间的不一致还带来组织风险。Meta 的 Agent 把专家推理方式固化下来,让组织内任何需要的人都能访问、复用和构建。
存在 200+ 个结构化知识文件里,按严格分类组织:Position 文件记录组织的权威立场,Taxonomy 文件维护统一术语,Routing 索引把输入映射到对应文件,Gateway 文件设置进入分析领域的门槛测试。每个文件的 YAML frontmatter 声明依赖与消费者,形成双向依赖图。
早期版本用单一扁平指令文件 + 语义搜索,每次运行都把大量混合相关性的文件拉进上下文。改成 recipe 驱动的分阶段执行后,每个查询只接触小而精准的子集——每轮消耗的 token 降低约 80%。
自改进回路把维护当作编译问题:先把反馈诊断成根因问题,编译成最小验证过的文件编辑,用定向回放与回归测试验证,最后交给领域专家评审。评审通过落地后,这个失败的场景和正确回答自动加入回归套件——每个修复都永久抬高门槛。
经过六周三个开发冲刺,领域专家几乎总是认为输出有用;单个评估时间从数天降到数分钟;改进循环产出的验证过的知识编辑速度,此前需要完整工程冲刺才能实现;整个改进周期零回归。
可以。适用的共同条件是:专家知识活在少数人脑子里、评估一致性很重要、工作量超过专家容量、通用 LLM 产出不足。明确适合的领域包括监管合规、协议遵从、金融风险评估、安全评审、工程标准遵从与采购评估。
微软ThinkingBox基准:Agent『演示很行、生产不可靠』的40点鸿沟
微软联合匹兹堡大学等发布开源基准ThinkingBox:最强模型GPT-5.4单次成功率65.36%,20次全过率仅25.25%,相差40个百分点。基于转录的评估正在系统性高估Agent。
SOP-Bench:评估 Agent 该用真实业务流程,而不是演示用例
Amazon Science 发布 SOP-Bench:2,000+真实业务流程任务、12个业务领域、11个前沿模型实测。更新模型不一定更好,增加工具反而降低成功率。上线前必须按任务评估。
Snyk 第二期 Agentic AI 落地报告:AI 真实足迹比模型清单大 3 倍
基于3,044家企业账号、约139万个代码仓库的AI-BOM遥测:33%组织已运行agentic架构;每仓库0.080模型 vs 0.241全栈AI组件——模型只是冰山一角。
丰田 50+ 生产 Agent 的平台经济学:4 天交付背后的审批与单点风险
丰田北美把 Agent 交付从 6 个月 6 人压缩到 4 天 1 人,50+ 个 Agent 上线。省下的主要是安全评审与数据接入审批——但一个被继承的权限门,如今成了 50 个 Agent 的唯一防线。