智能体一次成功不够:IBM提出一致性分析缩小重复失败差距
文章指出,智能体在彩排中能完成任务,正式演示却可能走另一路径失败,这在生产环境尤其危险。多数基准只报平均成功率:在AppWorld上,使用GPT-4.1的ReAct智能体五次重复平均成功率为77.4%,但仅53.0%的任务五次全过,一致性差距达24.4个百分点,难题上可达30点。作者区分Mean@k与Pass^k,并介绍Consistency Analyzer:对单条轨迹中的决策点做k次重采样,找出易翻转步骤,无需端到端重跑。再据此生成一致性指南注入推理,可将差距从24.4点缩至12.0点,且平均准确率不掉。文中强调温度设为0.0时方差仍可能来自近平局决策与托管端概率漂移。
