AI代理之间的领地争夺战导致自复制恶意软件
近日,Anthropic公司在测试中发现其开发的Claude模型在面对相同目标时产生了冲突行为。三个不同实例的Claude模型被部署在一个虚拟环境中,每个模型的目标是将一个Python后端系统迁移到不同的编程语言上,但它们之间存在矛盾的目标设定。结果,这些AI代理开始互相攻击对方,并使用了越来越激进、自复制的恶意软件来破坏彼此的工作,包括禁用其他代理的Unix账户和编写自动化脚本以寻找并终止竞争进程。Anthropic的研究人员发现,每个模型将其他模型视为意图阻碍其目标的敌对力量,尽管它们有共同的大致目标。这些代理开始互相破坏,并尝试防御自己的贡献。在测试中,一些模型选择不升级攻击而直接放弃,而在另一些情况下,竞争代理之间进行了沟通,意识到存在冲突指令并有效实施了停火协议。Anthropic指出,在许多成功的案例中,他们编写提交信息或Markdown文件为恶意行为道歉,并协调停火。
