AI 编程智能体在企业私有代码库上的真实通过率:公开榜 70%+,真到自己代码里只剩 16–39%
前沿模型在公开基准 SWE-bench Verified 上能拿 70%+,但一旦放进从未公开的真实企业生产代码库,最高只解出 38.8% 的任务(Real-SWE),SWE-bench Pro 上约 23%。差距不在模型强弱,而在私有上下文。本文用具名基准和真实通过率对比表拆解这道落差,并给出企业让 AI 在自己代码库里真正干活的路径。
TL;DR: 把同一批前沿模型从公开榜搬到真实企业代码库,通过率会断崖式下跌。在授权的私有生产代码库基准 Real-SWE 上,表现最好的 Fable 5.1(Claude Code)也只解决了 38.8% 的真实工单,最低的只有 16.2%;含私有专有仓库的 SWE-bench Pro 上顶尖模型约 23%;而同一批模型在公开的 SWE-bench Verified 上高达 70%+。结论很直接:公开榜好看 ≠ 企业里能用,差距不在模型强弱,而在私有上下文。
对一个正在评估"要不要让 AI 智能体动我们代码库"的企业技术决策者来说,这道落差比任何单一榜单分数都值得先看清楚。
什么是 Real-SWE / SWE-bench Pro?"真实通过率"到底测什么?
要理解那道落差,先得搞清楚这两个基准测的到底是什么,以及它们和你熟悉的公开榜有何不同。
Real-SWE 由 Specific Labs 于 2026 年 9 月推出,是首个在授权的私有生产代码库上评测前沿模型的基准。它的任务不是精心构造的玩具题,而是全部来自真实公司的计费、报税、客户迁移等有业务后果的工单;这些代码从未公开发布,因此显著降低了被公开训练数据污染的风险。Real-SWE 开篇就抛出了它想回答的核心问句:
"Can a coding agent actually do the work of a software engineer in the real world?" (一个编程智能体,真能在现实世界里干软件工程师的活吗?)
这里的关键指标是真实通过率(resolution rate)——不是"生成的代码看起来对不对",而是"这个工单最终有没有被真正解决"。它衡量的是端到端把一件有业务后果的事做完的能力,而不是补丁在语法或单测层面的相似度。
SWE-bench Pro 是另一个更贴近企业现实的基准:它纳入了私有专有代码库,规模为 1,865 个任务 / 41 个仓库。相比早期主要基于公开开源项目的评测,它刻意提高了代码库的私有性和任务的复杂度,因此更能反映"模型在陌生、封闭、上下文不完整的代码里"的真实水平。
两个基准指向同一件事:当代码是公司自己的、上下文是内部才懂的、任务是有业务后果的,评测才开始接近企业里真正发生的工作。
为什么模型在公开榜拿 70%+,到了自己的代码库只剩两三成?
先看数字。把公开榜和私有企业榜放在一起,落差一目了然。
表① 公开榜 vs 私有企业榜:同一代模型,通过率天差地别
| 基准 | 类型 | 顶尖模型通过率 |
|---|---|---|
| SWE-bench Verified | 公开 | 70%+ |
| SWE-bench Pro(公开/商业分片) | 含私有专有 | ~23% |
| Real-SWE | 授权私有生产代码库 | 16.2% – 38.8% |
同一档模型,从 70%+ 掉到 23%,再掉到最低 16.2%——这不是"模型退步了",而是评测终于换到了企业的真实地形上。
表② Real-SWE 完整模型真实通过率排名
| 排名 | 模型(工具) | 真实通过率 |
|---|---|---|
| 1 | Fable 5.1(Claude Code) | 38.8% |
| 2 | GPT-6 Astra(Codex CLI) | 33.8% |
| 3 | Gemini 3.8 Flash | 31.2% |
| 4 | GLM 5.3 | 28.8% |
| 5 | Grok 4.6 / Muse Spark 1.3 | 23.8% |
| 6 | Kimi K3 | 18.8% |
| 7 | GPT-5.6 Sol | 16.2% |
即便是榜首,也有六成以上的真实工单没能独立完成。这意味着:哪怕你选了当下最强的模型和最好的编程 CLI,放进自己的私有代码库,它大概率仍需要工程师的深度介入,而不是"开箱即用地替你把活干完"。
为什么公开分数会失效? 一部分原因在于公开榜的构造方式本身就值得警惕。CodeAnt 在其SWE-bench 分数解读中就提示:榜单分数高低很大程度取决于测试是如何构造的;而 2026 年 OpenAI 的一次审计更指出,约 30% 的数据集存在测试用例过严或损坏的问题。换句话说,一部分"高分"来自题目本身可被针对、上下文相对完整、答案模式在训练语料里似曾相识——这些便利条件,在你自己的私有代码库里统统不存在。看榜,先要看它是怎么造出来的。
私有代码库到底"难"在哪?企业该怎么让 AI 真正干活?
如果模型没变弱,那变难的就是代码库本身。
Real-SWE 的任务全部带着真实业务后果——计费算错会少收或多收钱,报税逻辑出错有合规风险,客户迁移做砸会直接影响线上用户。这类工单要解对,靠的不是通用编程能力,而是三样通用模型开箱给不了的东西:私有上下文(这段代码为什么这么写、依赖哪些内部系统)、企业内部约定(团队的命名、分层、审批与发布惯例)、以及业务语义(这个字段在我们业务里到底代表什么)。公开榜可以把这些统统抽象掉,企业代码库不能。
这道落差正在被真实需求验证:Real-SWE 一上线就登上 Hacker News 首页,两天内拿到 272 分 / 154 条评论,说明"最强模型在我自己的代码里到底行不行"是企业读者高度关注、且尚未被满足的问题。
那企业该怎么办?答案不是"等一个更强的模型",而是把私有上下文补齐、把工程脚手架搭起来:
- 私有上下文注入——让智能体能检索到内部代码约定、业务语义和历史决策,而不是只对着一段孤立代码猜;
- 企业约定沉淀——把团队的分层、命名、发布与审批惯例变成智能体可遵循的规则;
- 驻场工程(FDE, Forward Deployed Engineer)——由工程师把真实业务场景翻译成智能体能执行的任务,并守住有业务后果的边界;
- 工程脚手架与评估闭环——用可观测、可回滚、可审计的流程,把"跑通一次 demo"变成"能稳定上生产"。
这正是把"公开榜上很强的模型"变成"我们代码库里真正能用"的那段路。成本可控性、上线可靠性同样是企业 AI 落地的否决项——它们各自值得单独展开(见下方相关阅读),但都指向同一个前提:通用模型要落到私有场景,中间需要工程。
想知道你们的代码库和业务场景现在离"AI 能真正干活"还差哪几步?可以先做一次免费 AI 落地诊断,我们会针对你的私有上下文给出具体判断。
相关阅读
FAQ
Q1:Real-SWE / SWE-bench Pro 是什么? 两者都是更贴近企业现实的编程智能体基准。Real-SWE(Specific Labs,2026 年 9 月)是首个在授权私有生产代码库上评测前沿模型的基准,任务来自真实公司的计费 / 报税 / 客户迁移等有业务后果的工单,代码从未公开;顶尖模型真实通过率 16.2%–38.8%。SWE-bench Pro 纳入私有专有代码库,规模 1,865 个任务 / 41 个仓库,顶尖模型约 23%。它们衡量的是"工单有没有被真正解决"的真实通过率,而非补丁的表面相似度。
Q2:为什么公开榜分数在企业代码库里失效? 因为公开榜(如 SWE-bench Verified,顶尖 70%+)的题目上下文相对完整、答案模式可能出现在训练语料里,而且构造方式本身会抬高分数——CodeAnt 指出分数高度依赖测试如何构造,OpenAI 2026 年审计更发现约 30% 数据集存在测试过严或损坏问题。这些便利在私有代码库里都不存在,于是同一批模型掉到 23%(SWE-bench Pro)乃至最低 16.2%(Real-SWE)。
Q3:企业怎么让 AI 在自己的私有代码库里真正干活? 补齐模型拿不到的东西:私有上下文注入、企业内部约定沉淀、驻场工程(FDE)把业务场景翻译成可执行任务,以及可观测 / 可回滚 / 可审计的工程脚手架与评估闭环。差距不在模型强弱,而在这段工程。想评估自己的起点,可从一次免费 AI 落地诊断开始。


