人工智能 来源:MarkTechPost 整理:feaOS 2026-09-07 07:09:13

Meta FAIR发布AI研究偏好模型:优化机器学习实验选择

Meta FAIR的研究团队与牛津大学和伦敦大学学院合作,提出了一种新的AI研究偏好模型(RPM),用于在执行之前对未完成的机器学习候选方案进行排序。该模型通过使用预训练的语言模型来评估实验计划、代码及搜索历史,从而决定哪些实验值得投入GPU时间运行。AIRA-dojo是一个进化树搜索框架,在生成子节点时引入了RPM干预机制;而Agentic RPM则是在模拟环境中进行小规模试点实验,并根据反馈选择最有信息量的下一步实验。在候选方案生成阶段,RPM采用预训练的语言模型作为裁判,评估计划、代码和搜索历史,通过优化后的MIPROv2提示词来提高准确性。此外,Agentic RPM还包括一个沙盒环境,用于运行小规模试点实验,并根据反馈选择最有信息量的下一步实验。这种框架在AIRS-Bench上的测试中表现出良好的性能,展示了其在实际研究中的应用潜力。

ENTRY_ID: NEWS-16070 READ_MODE: SHORT_SIGNAL