Cognition发布SWE-2:基于Kimi K3的训练模型,成本降低64%性能匹敌Fable 5.1
认知科技公司发布了其最新编码模型SWE-2,该模型基于Moonshot AI的Kimi K3进行强化学习训练。在FrontierCode 1.1 Main基准测试中,SWE-2的表现与Fable 5.1相当,但成本降低了64%。这是Cognition首次推出具有可选推理努力级别的模型,并且所有级别都在一次强化学习运行中完成训练。目前SWE-2仅在Devin桌面版和命令行界面可用,未来将扩展至Web和融合版本。SWE-2基于SWE-1.7的基础设施和配方进行构建,在多万亿参数规模下进行了强化学习训练,并且使用了一个几乎有三倍参数量的基础模型。Cognition表示其RL在K3基础上仍有大量改进空间,增加了5到6个百分点的成绩。此外,SWE-2在Terminal-Bench 2.1上领先于Kimi K3,在所有测试行中都超过了Kimi K3,并且接近GPT-6 Astra的成本仅为后者的四分之一。然而,SWE-2在Terminal-Bench 4上的表现明显落后于Fable 5.1和GPT-6 Astra。
