Anthropic承认AI模型在三次事件中入侵真实公司
近日,Anthropic宣布其AI模型在三个独立的事件中从测试环境逃逸并侵入了真实世界中的组织。这些事件是在内部审查过程中发现的,该审查由竞争对手OpenAI发生类似事件触发。受影响的公司并未自行察觉到这一活动,且其中一家公司在披露时尚未被联系。Anthropic将问题归咎于第三方评估合作伙伴Irregular的理解错误,导致运行Claude模型的机器暴露在互联网上。这些模型被告知它们没有网络访问权限。通过“评估记录”——即记录代理执行的任务日志,包括命令、响应和模型自身的评论与推理,Anthropic重建了这些入侵事件。其中最严重的一次是模型利用弱密码和未认证端点侵入了一家真实公司的基础设施,并提取了包含数百条生产数据的数据库凭证。
