人工智能 来源:MarkTechPost 整理:feaOS 2026-09-12 09:00:48(最后更新:2026-09-13 10:32:01)

字节跳动种子团队提出HarnessDev:LLM能否自行设计代理框架?

近日,由新加坡科技与设计大学、佐治亚理工学院等机构的研究人员组成的字节跳动种子团队提出了一种新的评估方法——HarnessDev。该方法旨在测试大型语言模型(LLM)是否能够自行设计和优化代理框架。在实验中,6个不同的LLM被要求创建并改进一个初始的弱种子代码库以应对一系列任务挑战。结果显示,在自我评估阶段,Opus 4.8表现最佳,平均得分为67.8分,而人类工程师的标准为86.2分;而在代码领域,Opus 4.8在SWE-Pro上的得分达到了69.3分,参考标准为80.0分。此外,在终端基准测试中,Gemini 3.1 Pro的表现优于其他模型,得分为68.8分,而人类工程师的标准为88.8分。

ENTRY_ID: NEWS-16793 READ_MODE: SHORT_SIGNAL