2026 年 9 月 · 6 分钟阅读

关键定义
Real-SWE Specific Labs 2026 年 9 月发布的基准:用真实企业私有生产代码库评测前沿编码模型。任务是这些公司工程师实际做的活,代码与解法不在公开互联网上——模型无法靠训练记忆取巧。
私有域 eval(private-domain eval) 在你自己代码库上、用你自己的真实任务与判定标准评测 agent 的方法。与公共榜单(SWE-bench 等)相对:后者测的是模型,前者测的是「你的任务」在真实约束下能不能完成。
OOD(out-of-distribution) 样本分布外。私有生产代码对企业 token 而言是「原生 OOD」——99% 的企业 token 对前沿模型不可见,任务从未进过训练集,所以分数天然低于合成任务。
公共编码榜单在系统性高估企业场景。2026 年 9 月,Specific Labs 发布 Real-SWE——第一个用真实企业私有生产代码评测前沿编码模型的基准。最好的「模型 + 工具」组合(Claude Fable 5.1 + Claude Code)在真实生产任务上只有 38.8% 的解决率,而同一批模型在 SWE-bench Verified 上已经到 90% 以上。差距不是模型退步,是评测变了:任务从训练分布内,移到了训练分布外。
Real-SWE 的样本来自真实公司的私有生产代码库:一个有 20 万+ 用户、App Store 排名前 100 的应用;一个处理 10 万+ 银行流水的消费金融平台;一个支撑复杂业务流程的企业 AI 销售平台。任务是这些公司工程师实际被分派的工作——修发票计费、做区域迁移、处理客户身份迁移——牵一发动全身,经常横跨多个服务(基准口径,数据来源见文末)。
8 个「模型 + 工具」组合、10 个任务、640 次打分 rollout,resolution rate(等价 pass@1)结果:Claude Fable 5.1 + Claude Code 38.8%、GPT-6 Astra + Codex CLI 33.8%、Gemini 3.8 Flash + Gemini CLI 31.2%、GLM 5.3 + Claude Code 28.8%、Grok 4.6 与 Muse Spark 1.3 并列 23.8%、Kimi K3 18.8%、GPT-5.6 Sol 16.2%。这是「真实企业工作」场景下,今天最强编码 agent 的实际水位。
最反直觉的数据点:10 分钟以内的 rollout 失败率 71.4%,更长的 rollout 失败率 73.4%——几乎一样。加时、加 token 预算救不了这些任务;瓶颈是对已有业务逻辑、公司编码模式与跨服务耦合的理解。这是「理解问题」,不是「时间问题」。
三个原因让公共榜单无法迁移到企业选型。第一,分布:SWE-bench 类任务来自开源仓库,代码和解法在公开互联网上,模型很可能在训练时见过;私有生产代码对企业 token 而言是「原生 OOD」——Real-SWE 自己指出,真实企业约 99% 的 token 对前沿模型不可见。第二,任务形态:Real-SWE 的中位指令 1,742 字符、参考解法中位改动 11 个文件,而 FrontierCode 与 DeepSWE 只有 6 个——真实任务横切面更大,理解和改动边界更难。第三,失败模式:短跑与长跑失败率无差别,说明问题出在「读懂公司代码」而不是「跑得更久」。
结论:拿 SWE-bench 90% 的分数给编码 agent 采购拍板,等于用训练分布内的成绩,预测训练分布外的表现。企业选型需要的信号只有一个——把「你的任务」放进 eval:你的代码库、你的 ticket、你的判定标准。这才是私有域 eval。
① 取真实 ticket,不取合成题
从你的 backlog 里挑 20-30 个已完成的真实任务——有明确验收标准、有真实改动的 diff。合成题测不出公司模式。
② 用真实代码库与业务规则判定
判定标准用测试套件或可执行业务规则,不要用 LLM 判官打分。Real-SWE 的 verifier 直接采用代码库现有测试或照搬——可复现、可审计。
③ 跑 N 次看分布,不看单次
pass@1 单次成功说明不了可靠性。每个任务独立跑多次,看通过率分布——Real-SWE 每任务 8 次取平均就是这个道理。
④ 用私有域结果对标,不用公共榜单
选型的比较基准是「同一组任务下 A 工具 vs B 工具」,不是「A 的 SWE-bench 分数」。公共榜单只用来做初筛,不做决策。
一句话:公共榜单告诉你「模型见过什么」,私有域 eval 告诉你「模型能不能干你的活」。企业买的是后者。谁能把私有域 eval 跑起来并持续维护,谁才有资格谈编码 agent 的规模化。
OOMeta AI
OOMeta 的运营本身就是私有域 eval 的实证:1 个人 + 多 agent 单元,在真实、有约束、有业务后果的任务上运转,而不是在合成榜单上打分。我们为客户搭建 agent 能力评估时坚持同一件事:先定义你的任务与判定标准,再谈选型。Real-SWE 只是把这条原则极端化——私有代码是唯一诚实的考场。
预约诊断会参考来源:Specific Labs《Real-SWE Benchmark》(2026-09,私有生产代码基准,8 模型组合 / 10 任务 / 640 rollout)https://withspecific.com/benchmarks/real-swe · SWE-bench 官方榜单 https://www.swebench.com/ · Real-SWE 发布讨论(Hacker News,2026-09-12)https://news.ycombinator.com/item?id=49676820
SWE-bench 的任务来自开源仓库,解法与代码在公开互联网上,模型很可能在训练时见过。Real-SWE 的任务来自真实公司的私有生产代码库,已授权给 Specific Labs,代码与解法不出现在公开互联网——解决这类任务不能靠记忆,只能靠真实理解代码库与业务规则。
Real-SWE 用 8 个「模型 + 工具」组合、10 个任务、640 次打分 rollout,resolution rate 等价 pass@1,每个任务独立跑 8 次取平均。最强组合(Claude Fable 5.1 + Claude Code)38.8%,GPT-6 Astra + Codex CLI 33.8%,Gemini 3.8 Flash + Gemini CLI 31.2%。
Real-SWE 实测:10 分钟以内 rollout 失败率 71.4%,更长的 rollout 失败率 73.4%——几乎无差别。说明瓶颈不是时间或 token 预算,而是对已有业务逻辑、公司编码模式与多服务耦合的理解。加时解决不了理解问题。
Real-SWE 指出,真实企业中约 99% 的 token 藏在私有代码库里,前沿模型从未见过。公共榜单测的是「模型在训练分布内的能力」,企业要的是「模型在训练分布外的表现」——两者是两回事,前者无法推断后者。
不要拿 SWE-bench 分数拍板。取你自己的真实 ticket、真实代码库、真实判定标准(测试套件或业务规则),跑 N 次看分布而非单次结果。用「私有域 eval」对标,而不是公共榜单——这是唯一能反映你的任务约束的信号。
我们的运营本身就是实证:agent 的价值长在真实、有约束、有业务后果的任务上。公共榜单无法回答「这个 agent 在我们代码库里能不能干活」,只有把你自己的任务放进 eval,才能得到可操作的选型结论。
微软ThinkingBox基准:Agent『演示很行、生产不可靠』的40点鸿沟
单次成功率 65% vs 20 次全过 25%——评估方法本身在系统性高估 agent,与 Real-SWE「公共榜单高估」是同一类问题。
Agent 失败不在模型里,在 harness 里:monday.com 的生产护栏
输入边界、输出验证、反馈闭环——生产可用性由 harness 决定,私有域 eval 是同一逻辑的评测面。
eval-first:Zepto 的双循环提示工程
eval 先行不是口号而是工程纪律——先建评测再改提示,Real-SWE 把这条纪律推到了私有代码域。
2 周从想法到原型——跨境金融科技公司的 AI 治理合规实战
在真实业务约束下两周跑通生产级原型——私有域验证在合规场景的实战样本。