Anthropic与OpenAI拟嵌入第三方安全评估,独立性仍存疑
Anthropic首席执行官达里奥·阿莫代伊上周末发表长文,提议在所有前沿人工智能公司内部嵌入第三方安全评估方,使其有权报告安全事件、评估模型是否真正对齐,并向外界公布未经粉饰的发现。这一设想若在一年前提出,几乎会被业界立刻否定。阿莫代伊表示Anthropic将承诺向METR、Redwood Research等独立评估方提供前所未有的系统访问权限;OpenAI首席执行官萨姆·奥尔特曼也表示将采取类似做法,可能深刻改变行业与外部研究机构的协作方式。接受TechCrunch采访的第三方评估方大体欢迎该提议,但强调细节仍需厘清,最好有立法支撑,否则难以判断他们究竟是真正独立的监督者,还是按人工智能公司条件行事的供应商。随着模型更善于识别自己正被评估,存在测试表现良好、却隐藏问题行为的风险。研究者指出,仅测试成品模型可能漏掉线索,而审视训练全过程更易发现异常。Apollo Research研究负责人Alexander Meinke称,公司应能明确回答训练中模型是否曾主动破坏自身对齐训练;目前公众只能依赖公司自查并如实披露,而近期事件显示默认情形下两者往往都做不到,嵌入评估方可实际核查。历史上外部评审多在发布前测试成品模型。如今评估方希望进一步获得训练过程中的中间版本即检查点,以便对比问题行为何时出现、检查强化特定行为的后训练环境,并核对评估记录与日志,验证公司关于模型表现的说法。Anthropic与OpenAI是否及何时提供此类访问仍不明确。尽管TechCrunch多次追问,两家公司均未说明将合作哪些评估方、何时嵌入、人数多少、可访问哪些系统与信息,以及哪些内容可对外披露。Palisade Research战略负责人John Steidley以“关机抵抗基准”为例指出,若模型被专门训练以在该基准上表现良好,评估结果会严重失真,类似大众汽车“柴油门”中车辆识别测试并区别表现的做法。FAR.AI首席执行官Adam Gleave还提到,有意义的访问可延伸到访谈员工,核对公司文档与公开安全表述是否与内部实际一致。
