BenchMIRT:评估大型语言模型基准测试的新方法
近日,Allen AI实验室推出了一种名为BenchMIRT的新型评估工具,用于分析和审计大型语言模型(LLM)在特定任务中的表现。该方法通过多维度项目反应理论(MIRT),能够更细致地分离出不同能力对模型性能的影响,并揭示现有基准测试中隐藏的不同信号。研究团队使用了100个LLM的评估结果,涵盖了包括安全性和通用推理在内的多种能力。实验结果显示,BenchMIRT不仅能确认许多基准测试的目标焦点,还能发现某些测试中的复杂情况,例如BBQ和WMDP等基准在不同维度上的表现差异。此外,BenchMIRT还能够帮助研究人员识别哪些问题最能反映模型的能力,并预测模型在未见过的问题上的表现。
