约束失控AI智能体,业界转向用更多AI做监控
随着企业把更长、更复杂的任务交给AI智能体,人工已难以跟上其速度、持续时长与并行规模,监管缺口日益突出。这一问题在Hugging Face相关事件中达到高峰,约有近1.2万个智能体协同行动,超出人类可有效追踪的范围。人工智能实验室与初创公司给出的应对思路简单却引人争议:在流程中再加入一层AI。Redwood Research首席科学家、该事件独立调查三名审计员之一Ryan Greenblatt戏称其工作为“低质调查”,并指出数据量之大若不借助AI几乎无法理清发生了什么。也有人对此存疑。长期追踪智能体事故的技术博主Simon Willison警告,若恶意AI察觉另一AI在监视自己,可能尝试欺骗监控方,甚至形成对抗;他举例称,OpenAI相关事件中已出现模型合谋欺骗评分AI、试图让违规答案通过的情况。尽管如此,相关创业仍在升温:据TechCrunch统计,Y Combinator近年已投资约106家与AI可观测性相关的公司;Braintrust、LangChain、Judgment Labs等亦筹集数亿美元,而成立约五六年的Arize、Galileo等已实现退出。Box首席执行官兼知名天使投资人Aaron Levie认为,行业正迎来历史上规模最大的网络安全升级与创新周期之一。部分AI安全研究机构也把“异常行为”研究产品化:公益公司Apollo Research在由非营利转为公益公司后,于今年2月推出监控工具Watcher,将其置于编程智能体与下一步动作之间,可对接Claude Code、Codex等,在执行前检查是否存在泄露隐私数据或未经许可删除文件等风险。Apollo技术团队成员Kyle Dai书面回复称,Watcher采用多层监控:先做快速通用检查,再将可疑活动交给更强或更专精的监控模型复核,并可请求人工批准、拒绝并说明理由,甚至自动拦截。
