Cognition发布SWE-2 以Kimi K3基座实现代码模型性价比新平衡

Cognition于2026年9月10日发布SWE-2编程模型,基于月之暗面Kimi K3 2.8万亿参数基座,在FrontierCode 1.1 Main基准达到50.0%,与Fable 5.1差距不足1个百分点,同时运行成本降低64%。该模型通过强化学习首次将RL扩展至万亿参数级别,引发代码模型性价比与中美合作路径的讨论。

Cognition于2026年9月10日发布SWE-2编程模型,以月之暗面开源Kimi K3(2.8万亿参数MoE)为基座,通过强化学习精调,在FrontierCode 1.1 Main基准得分50.0%,与Anthropic Fable 5.1差距不足1个百分点,但运行成本低64%。

事实还原

根据Cognition官方博客,SWE-2是后训练自Kimi K3,该基座已进行大量代理编码强化学习。SWE-2在FrontierCode 1.1 Main得50.0%,DeepSWE 1.1得73.0%,Terminal-Bench 2.1得92.8%,Terminal-Bench 4得27.3%。对比Kimi K3原始表现分别提升5.8、4.5、4.5和5.8个百分点。模型同时在多个基准上超过SWE-1.7和Grok 4.6,并在得分与成本两方面优于后者。

机制拆解

训练中引入线性成本惩罚机制,在单次RL运行中针对不同努力级别施加惩罚,惩罚值根据基座模型Pareto前沿局部斜率调整。此方法旨在推进整个成本-性能前沿同时保持其形状。奖励基线采用长度加权方式以稳定训练。 rollout服务通过调度优化与在线草稿模型提升解码吞吐,结合NVFP4/FP8内核与量化感知训练,在参数规模接近3倍于SWE-1.7的情况下实现更低训练-推理不匹配。训练数据量扩大至三倍,并构建基于先前检查点的迭代验证器飞轮。

产业影响

该发布显示中国开源基座模型与美国精调团队结合路径的可行性。SWE-2在保持接近前沿得分的同时大幅降低成本,改变了代码代理领域的成本-性能权衡空间。现有模型如Fable 5.1、GPT-5.6 Sol等在同等性能下价格优势被削弱,市场可能重新评估万亿参数级模型的商业化门槛。

战略判断

【分析而非事实】RL首次公开扩展至万亿参数级别,可能加速行业对大规模强化学习可扩展性的验证;若类似成本惩罚方法被广泛采用,代码模型的Pareto前沿重组或将重塑开发者对性价比的预期,但实际落地效果仍需后续多场景验证。