谷歌展示双盲测试Gemini的方法
随着数据集和公共基准的不断扩大,判断AI模型是否在未见过的数据上进行测试变得越来越困难。近日,谷歌DeepMind展示了首个双盲评估方法,用于测试Gemini等前沿AI模型。该方法通过使用加密技术确保双方都无法访问对方的数据,从而保证了测试结果的真实性和公正性。此次试点测试中,Gemini 2.5 Flash Lite与来自MLCommons和新加坡人工智能安全研究所的私人基准进行了对比。谷歌强调这种评估方式的重要性,并指出此前的研究发现约一半的AI模型存在基准泄露问题,这可能导致评分虚高,特别是对于大型模型而言。
