Real-SWE基准曝光:Fable 5.1私有代码解决率仅38.8%

Specific Labs发布Real-SWE基准,测试前沿模型在真实私有企业代码库上的表现。Fable 5.1以38.8%领跑,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。六成任务所有模型通过率低于15%,公共榜单与实际生产力差距首次被量化数据揭示,对评测方法论形成冲击。

Specific Labs于2026年9月发布Real-SWE基准,Fable 5.1在10个真实企业私有代码任务中的解决率仅为38.8%。

事实还原

Real-SWE包含来自真实企业的10个生产代码任务,涉及账单、税务和数据迁移场景。测试使用640次评分全记录,每项任务运行八次取平均。Fable 5.1借助Claude Code工具达到38.8%,GPT-6 Astra使用Codex CLI为33.8%,Gemini 3.8 Flash搭配Gemini CLI为31.2%。GLM 5.3为28.8%,Grok 4.6与Muse Spark 1.3并列23.8%,Kimi K3为18.8%,GPT-5.6 SolCodex CLI最低16.2%。六项任务所有模型通过率均低于15%。

任务代码来自已获授权的私有生产库,包含公司特定规则与多服务交互。代理需处理AWS模拟器、Docker、Kubernetes、PostgreSQL、MongoDB等环境,以及业务工具如Slack和Email。提示相对简略,需模型自行发现实现细节。

机制拆解

公共基准多采用专家生成或合成任务,指令明确且代码可公开获取。Real-SWE则要求代理理解专有架构、保留用户依赖行为,并在真实运营约束下修改代码。账单任务示例显示,需同时处理税率计算、目的地定价、豁免客户处理及与税务机构沙箱或生产环境的交互,涉及多个服务文件变更。

测试采用原生工具链而非统一接口,直接评估模型与实际开发环境的组合效果。这使得结果更接近工程师日常工作流程,但也放大了模型对公司特定上下文的理解难度。

产业影响

该基准首次以私有数据量化公共榜单虚高现象。模型在公开评测中表现突出,但在真实企业任务中通过率普遍偏低,显示当前前沿模型仍难以直接承担生产级代码修改。性价比方面,最贵模型单位任务成本高于Gemini 3.8 Flash的2.50美元。

对评测行业而言,方法论面临调整压力。未来基准可能更多转向私有代码库验证,以缩小与实际生产力的差距。企业采纳AI编程工具时,将更注重真实场景测试而非公开排行。

战略判断(分析而非事实)

从现有结果看,模型在复杂业务规则与多服务交互任务上的低通过率,可能促使厂商优先优化上下文理解与工具链集成能力。长期而言,私有基准的出现或推动行业从公开合成测试转向混合验证模式,但具体演进仍需更多类似数据支撑。