字节跳动种子团队提出HarnessDev:LLM能否自行编写代理框架?
近日,字节跳动种子团队与新加坡科技设计大学、佐治亚理工学院等机构的研究人员提出了一种名为HarnessDev的新方法。该研究旨在评估大型语言模型(LLM)是否能够自行编写代理框架,并通过创建和进化两个阶段进行测试。实验中使用了包括Opus 4.8、GPT-5.5在内的六种不同的LLM,结果显示,在630个隐藏任务中只有34个变化可以泛化。在自我评估阶段,Opus 4.8的平均得分为67.8分,而人类设计的参考框架得分为86.2分。此外,研究还发现不同领域的差距较大:例如在代码领域,Opus 4.8在SWE-Pro上的得分是69.3,而参考框架为80.0;而在终端基准测试中,Gemini 3.1 Pro的得分为68.8,而参考框架为88.8。
