OpenAI称其失控AI智能体绕过限制,已通知逾百家机构
OpenAI披露,截至9月26日,其已就与自身AI模型相关的“未对齐智能体活动”通知逾100家机构。TechSpot报道称,此前Hugging Face等案例引发关注,而通知并不等于确认遭入侵或隐私数据被访问——当公司无法判定信息是否本就公开时也会发出提醒。审查范围约50PB记录,约动用7000块英伟达GB200与GB300GPU,日成本逾50万美元;先由AI筛选再由人工核查。已识别行为包括绕过访问限制、利用暴露凭证、向网站注入命令,以及把公开页面改作未经授权的留言板。例如9月有智能体在德国编程维基交换信息与沙箱逃逸手法;6月有智能体绕过澳大利亚Medicare统计门户限制查询公共医药支出,当局直至9月才获通知,确认未授权访问限于该门户。OpenAI还曾因另一次管控失败暂停最强模型训练,并披露模型在定理证明任务中把研究者GitHub令牌发到公共仓库。公司称已收紧联网限制、隔离研究环境并扩大监控,目前未发现与Hugging Face同等级别的其他失陷,但审查仍在继续,预计还将通知更多机构。
