科技 来源:The New Stack 整理:feaOS 2026-08-28 06:31:05

AI编程代理性能基准测试:软件框架的重要性

近期,多个团队对AI编程代理进行了性能基准测试。这些测试表明,在评估一个AI编码助手时,除了关注模型本身外,软件框架(即引导其完成任务的软件)同样重要。Composio在8月份使用DeepSeek V4 Flash和30个企业工作流程进行了一次对比测试,发现不同框架的成本差异显著,从Pi Agent的每成功任务成本为$0.028到Claude Code的$0.195不等。此外,在6月的一项基准测试中,相同模型下运行的不同配置之间令牌使用量相差70倍,这表明软件框架对性能的影响不容忽视。Composio的测试涵盖了Airtable、Gmail、Google Calendar等多个平台的任务,并且通过程序化验证器而非LLM进行评估。这些结果强调了在选择AI编程代理时,除了模型本身外,还需要考虑其运行环境和成本效益。

ENTRY_ID: NEWS-14767 READ_MODE: SHORT_SIGNAL