前沿模型在公开基准 SWE-bench Verified 上能拿 70%+,但一旦放进从未公开的真实企业生产代码库,最高只解出 38.8% 的任务(Real-SWE),SWE-bench Pro 上约 23%。差距不在模型强弱,而在私有上下文。本文用具名基准和真实通过率对比表拆解这道落差,并给出企业让 AI 在自己代码库里真正干活的路径。
企业级 AI 落地服务。派 FDE 驻场,把 AI 长进你的业务流程,大幅节省成本、赢得竞争。
© 2026 晨启科技(6AM TECH)· AI-Native Precision · 保留所有权利