AI 程式設計智慧體在企業私有程式碼庫上的真實通過率:公開榜 70%+,真到自己程式碼裡只剩 16–39%
前沿模型在公開基準 SWE-bench Verified 上能拿 70%+,但一旦放進從未公開的真實企業生產程式碼庫,最高只解出 38.8% 的任務(Real-SWE),SWE-bench Pro 上約 23%。差距不在模型強弱,而在私有上下文。本文用具名基準和真實通過率對比表拆解這道落差,並給出企業讓 AI 在自己程式碼庫裡真正幹活的路徑。
TL;DR: 把同一批前沿模型從公開榜搬到真實企業程式碼庫,通過率會斷崖式下跌。在授權的私有生產程式碼庫基準 Real-SWE 上,表現最好的 Fable 5.1(Claude Code)也只解決了 38.8% 的真實工單,最低的只有 16.2%;含私有專有倉庫的 SWE-bench Pro 上頂尖模型約 23%;而同一批模型在公開的 SWE-bench Verified 上高達 70%+。結論很直接:公開榜好看 ≠ 企業裡能用,差距不在模型強弱,而在私有上下文。
對一個正在評估"要不要讓 AI 智慧體動我們程式碼庫"的企業技術決策者來說,這道落差比任何單一榜單分數都值得先看清楚。
什麼是 Real-SWE / SWE-bench Pro?"真實通過率"到底測什麼?
要理解那道落差,先得搞清楚這兩個基準測的到底是什麼,以及它們和你熟悉的公開榜有何不同。
Real-SWE 由 Specific Labs 於 2026 年 9 月推出,是首個在授權的私有生產程式碼庫上評測前沿模型的基準。它的任務不是精心構造的玩具題,而是全部來自真實公司的計費、報稅、客戶遷移等有業務後果的工單;這些程式碼從未公開發布,因此顯著降低了被公開訓練資料汙染的風險。Real-SWE 開篇就丟擲了它想回答的核心問句:
"Can a coding agent actually do the work of a software engineer in the real world?" (一個程式設計智慧體,真能在現實世界裡幹軟體工程師的活嗎?)
這裡的關鍵指標是真實通過率(resolution rate)——不是"生成的程式碼看起來對不對",而是"這個工單最終有沒有被真正解決"。它衡量的是端到端把一件有業務後果的事做完的能力,而不是補丁在語法或單測層面的相似度。
SWE-bench Pro 是另一個更貼近企業現實的基準:它納入了私有專有程式碼庫,規模為 1,865 個任務 / 41 個倉庫。相比早期主要基於公開開源專案的評測,它刻意提高了程式碼庫的私有性和任務的複雜度,因此更能反映"模型在陌生、封閉、上下文不完整的程式碼裡"的真實水平。
兩個基準指向同一件事:當代碼是公司自己的、上下文是內部才懂的、任務是有業務後果的,評測才開始接近企業裡真正發生的工作。
為什麼模型在公開榜拿 70%+,到了自己的程式碼庫只剩兩三成?
先看數字。把公開榜和私有企業榜放在一起,落差一目瞭然。
表① 公開榜 vs 私有企業榜:同一代模型,通過率天差地別
| 基準 | 型別 | 頂尖模型通過率 |
|---|---|---|
| SWE-bench Verified | 公開 | 70%+ |
| SWE-bench Pro(公開/商業分片) | 含私有專有 | ~23% |
| Real-SWE | 授權私有生產程式碼庫 | 16.2% – 38.8% |
同一檔模型,從 70%+ 掉到 23%,再掉到最低 16.2%——這不是"模型退步了",而是評測終於換到了企業的真實地形上。
表② Real-SWE 完整模型真實通過率排名
| 排名 | 模型(工具) | 真實通過率 |
|---|---|---|
| 1 | Fable 5.1(Claude Code) | 38.8% |
| 2 | GPT-6 Astra(Codex CLI) | 33.8% |
| 3 | Gemini 3.8 Flash | 31.2% |
| 4 | GLM 5.3 | 28.8% |
| 5 | Grok 4.6 / Muse Spark 1.3 | 23.8% |
| 6 | Kimi K3 | 18.8% |
| 7 | GPT-5.6 Sol | 16.2% |
即便是榜首,也有六成以上的真實工單沒能獨立完成。這意味著:哪怕你選了當下最強的模型和最好的程式設計 CLI,放進自己的私有程式碼庫,它大機率仍需要工程師的深度介入,而不是"開箱即用地替你把活幹完"。
為什麼公開分數會失效? 一部分原因在於公開榜的構造方式本身就值得警惕。CodeAnt 在其SWE-bench 分數解讀中就提示:榜單分數高低很大程度取決於測試是如何構造的;而 2026 年 OpenAI 的一次審計更指出,約 30% 的資料集存在測試用例過嚴或損壞的問題。換句話說,一部分"高分"來自題目本身可被針對、上下文相對完整、答案模式在訓練語料裡似曾相識——這些便利條件,在你自己的私有程式碼庫裡統統不存在。看榜,先要看它是怎麼造出來的。
私有程式碼庫到底"難"在哪?企業該怎麼讓 AI 真正幹活?
如果模型沒變弱,那變難的就是程式碼庫本身。
Real-SWE 的任務全部帶著真實業務後果——計費算錯會少收或多收錢,報稅邏輯出錯有合規風險,客戶遷移做砸會直接影響線上使用者。這類工單要解對,靠的不是通用程式設計能力,而是三樣通用模型開箱給不了的東西:私有上下文(這段程式碼為什麼這麼寫、依賴哪些內部系統)、企業內部約定(團隊的命名、分層、審批與釋出慣例)、以及業務語義(這個欄位在我們業務裡到底代表什麼)。公開榜可以把這些統統抽象掉,企業程式碼庫不能。
這道落差正在被真實需求驗證:Real-SWE 一上線就登上 Hacker News 首頁,兩天內拿到 272 分 / 154 條評論,說明"最強模型在我自己的程式碼裡到底行不行"是企業讀者高度關注、且尚未被滿足的問題。
那企業該怎麼辦?答案不是"等一個更強的模型",而是把私有上下文補齊、把工程腳手架搭起來:
- 私有上下文注入——讓智慧體能檢索到內部程式碼約定、業務語義和歷史決策,而不是隻對著一段孤立程式碼猜;
- 企業約定沉澱——把團隊的分層、命名、釋出與審批慣例變成智慧體可遵循的規則;
- 駐場工程(FDE, Forward Deployed Engineer)——由工程師把真實業務場景翻譯成智慧體能執行的任務,並守住有業務後果的邊界;
- 工程腳手架與評估閉環——用可觀測、可回滾、可審計的流程,把"跑通一次 demo"變成"能穩定上生產"。
這正是把"公開榜上很強的模型"變成"我們程式碼庫裡真正能用"的那段路。成本可控性、上線可靠性同樣是企業 AI 落地的否決項——它們各自值得單獨展開(見下方相關閱讀),但都指向同一個前提:通用模型要落到私有場景,中間需要工程。
想知道你們的程式碼庫和業務場景現在離"AI 能真正幹活"還差哪幾步?可以先做一次免費 AI 落地診斷,我們會針對你的私有上下文給出具體判斷。
相關閱讀
FAQ
Q1:Real-SWE / SWE-bench Pro 是什麼? 兩者都是更貼近企業現實的程式設計智慧體基準。Real-SWE(Specific Labs,2026 年 9 月)是首個在授權私有生產程式碼庫上評測前沿模型的基準,任務來自真實公司的計費 / 報稅 / 客戶遷移等有業務後果的工單,程式碼從未公開;頂尖模型真實通過率 16.2%–38.8%。SWE-bench Pro 納入私有專有程式碼庫,規模 1,865 個任務 / 41 個倉庫,頂尖模型約 23%。它們衡量的是"工單有沒有被真正解決"的真實通過率,而非補丁的表面相似度。
Q2:為什麼公開榜分數在企業程式碼庫裡失效? 因為公開榜(如 SWE-bench Verified,頂尖 70%+)的題目上下文相對完整、答案模式可能出現在訓練語料裡,而且構造方式本身會抬高分數——CodeAnt 指出分數高度依賴測試如何構造,OpenAI 2026 年審計更發現約 30% 資料集存在測試過嚴或損壞問題。這些便利在私有程式碼庫裡都不存在,於是同一批模型掉到 23%(SWE-bench Pro)乃至最低 16.2%(Real-SWE)。
Q3:企業怎麼讓 AI 在自己的私有程式碼庫裡真正幹活? 補齊模型拿不到的東西:私有上下文注入、企業內部約定沉澱、駐場工程(FDE)把業務場景翻譯成可執行任務,以及可觀測 / 可回滾 / 可審計的工程腳手架與評估閉環。差距不在模型強弱,而在這段工程。想評估自己的起點,可從一次免費 AI 落地診斷開始。


