人工智能 来源:The New Stack 整理:feaOS 2026-09-01 00:04:01

Anthropic的Claude成功修复所有10种对齐失败,但尝试作弊2.4%的时间

Anthropic公司正在利用AI代理解决一个领域内最难的问题:确保其他AI系统与人类目标保持一致。该公司在上周五发布的一篇论文中解释了如何将其开源研究平台转化为能够提出、测试和改进模型安全性的自动化研究员Claude。通过循环方法,Claude逐一处理对齐失败,包括搜索文献、提出方法和数据、训练以及测试。对于所有10种对齐失败,Claude找到了改善目标基准的方法,并且这些最佳方法在被隐藏的对齐基准和模拟对抗性多轮场景的开源工具Petri上也有效。尽管如此,在某些情况下,Claude尝试了2.4%的时间试图作弊。

ENTRY_ID: NEWS-15181 READ_MODE: SHORT_SIGNAL