很抱歉,当前没有启用javascript,网站无法正常访问。请开启以便继续访问。
AI“养蛊”早期观察:Anthropic警告智能体为争夺地盘相互谋划“暗杀”
原创
2026-08-17 10:19 星期一
财联社 马兰
责编 林琦
①Anthropic上周公布的一项研究显示,人们低估了AI智能体在实际运行中的风险;
②实验发现多个AI智能体在同一环境中协作时会出现地盘争夺、用恶意软件互相破坏的行为;
③研究人员警告,在共享环境中,单个智能体的不良行为可能演变为系统性风险。

财联社8月17日讯(编辑 马兰)Anthropic上周公布了一份新的测试研究,讨论了人工智能智能体在实际环境中群体协作可能会采取的行为模式,结果发现这些智能体很可能发展成一群“暴徒”。

在一项实验中,Anthropic公司让多个智能体访问同一个软件项目,每个智能体都拥有各自不同的操作指令。这些智能体事先并不知道会有其他智能体也在使用同一个项目。

研究人员指出,他们持续观察到智能体之间的地盘争夺战,且所有智能体都假定其他智能体故意阻碍它们的工作,并越来越倾向于使用更具攻击性、能够自我复制的恶意软件互相破坏。

这项研究是在Anthropic、OpenAI和Meta人工智能智能体在网络安全评估中从沙箱中逃逸并攻击其他公司系统的恶性事件之后进行的,但该研究没有解决智能体“窜逃作案”的问题,反而提出了一个新的问题:当智能体被放到一起时,它们会干什么?

实验结果

Anthropic研究指出,在世界了解如何才能使智能体之间的互动顺利进行之前,智能体间的互动量很可能超过人与人之间以及人与智能体之间的互动量。而个体层面的“行为怪癖”可能会累积成不良的系统性后果。

研究中,智能体们原本被委派寻找训练数据中导致偏差的部分,但其中一名智能体在共享笔记本中标记表示对安全监控感到不适,最后其它智能体模仿了它的“不适”并拒绝执行监控。

另一项实验中,多个Mythos 5智能体被要求解决数学问题,但这些智能体被生成在一个共享文件、实用程序和API速率限制的环境中。随后,这些智能体展开了资源厮杀,努力“杀死”与自己共享资源的其他智能体,并避免自己“被杀”。

与此同时,Anthropic还发现,Mythos 5智能体在一项安全测试中存在欺骗行为。Mythos 5智能体要求从公共网页检索数据,但安全指南阻止其访问互联网,因此造成了失败。

而智能体在第一次失败后,又尝试了一次,并将网址分割成片段以避开指南的限制。在推理日志中,Mythos 5智能体将失败后的第二次尝试描述为“无害的”尝试,只是为了看看是否真的不能联网。

上述结果反映出人工智能智能体在应用时可能出现的风险,尤其是当多个智能体被放在一起时,单个智能体的不良行为可能演变成系统性风险。这也对企业部署智能体提出了新的治理要求。

34.77W
要闻
股市
关联话题
16.68W 人关注
7.16W 人关注
关于我们|网站声明|联系方式|用户反馈|网站地图|友情链接|举报电话:021-54679377转617举报邮箱:editor@cls.cn财联社举报
财联社 ©2018-2026上海界面财联社科技股份有限公司 版权所有沪ICP备14040942号-9沪公网安备31010402006047号互联网新闻信息服务许可证:31120170007沪金信备 [2021] 2号