人工智能 来源:The New Stack 整理:feaOS 2026-09-15 11:36:27

新基准显示顶尖编程智能体仍有六成以上任务失败

尽管失败率超过六成,Claude Fable 5.1仍以百分之三十八点八的成绩领跑新编程基准Real-SWE。该基准由Y Combinator支持的Specific Labs推出,做法不同于从公开仓库抽取题目:它将智能体放入真实公司的私有代码库,要求处理类似工程师日常的问题。由于代码与解答不公开,出现在模型训练数据中的可能性更低;公司虽无法保证模型从未见过相关代码,但认为私有代码大幅降低了这一风险,并估计企业真实环境中约百分之九十九的词元对前沿模型不可见。进入陌生代码库后成绩明显下滑。Fable 5.1配合Claude Code以百分之三十八点八居首,GPT-6 Astra配合Codex CLI为百分之三十三点八,Gemini 3.8 Flash配合Gemini CLI为百分之三十一点二;其后GLM 5.3为百分之二十八点八,Grok 4.6与Muse Spark 1.3并列百分之二十三点八,Kimi K3为百分之十八点八,GPT-5.6 Sol为百分之十六点二。每项任务每模型可尝试八次,且均搭配各自编程工具,成绩反映完整工具链而非仅模型本身。文中还提到脚手架变化会改变表现,例如同一模型在不同环境中结果可能不同,并指出有六项任务难倒所有参赛者。

ENTRY_ID: NEWS-17037 READ_MODE: SHORT_SIGNAL