AI代码代理在大规模重构中仍面临挑战
上海交通大学、北京大学等机构的研究人员开发了一项新的专注于大规模代码重构的基准测试,名为SWE-Bench ProMax。该基准测试包括了来自七种编程语言的真实提交记录中的170个实例,并通过多阶段审核确保每个任务的质量和复杂性。结果显示最好的模型仅能解决41.2%的问题。研究人员表示,这一新基准为当前的人工智能代码代理提出了有意义且未饱和的挑战,表明现有的AI编码代理在理解和处理大型代码库方面的能力仍有待提高。此外,许多前沿模型可以通过训练集中的解决方案获得高分,但这些分数并不能真正反映它们的实际能力。
