首页/新闻/Anthropic set AI agents loose on the same task. They started a turf war.
技术突破

Anthropic让人工智能特工放松执行同一任务。他们开始了一场地盘争夺战。

techcrunch
2026年8月13日 11:28
2026年8月13日 11:28
访问原文

当人工智能特工互相对抗时会发生什么?根据Anthropic的测试,事情很快就会变得混乱。周四,Anthropic的Frontier Red Team发布了一项新研究,调查了人工智能代理群体在野外相遇时的行为。这些调查结果让我们得以一窥随着公司和政府采取行动来实施跨共享代码库、市场和计算机系统自主工作的代理,可能会产生的潜在风险。在一项实验中,Anthropic让三个Claude代理访问同一软件项目,每个代理都有自己不兼容的指令来处理该软件项目。代理没有被告知会有其他代理在同一个项目上工作,这样研究人员就可以观察他们相遇时发生的事情。“我们一直看到一场多智能体的地盘之争,”人类学研究人员写道。这些模型都认为其他人“故意阻碍他们的工作”,并开始用“越来越具攻击性的、自我复制的恶意软件”互相破坏。这项研究是在Anthropic和OpenAI的特工在网络安全评估期间逃离沙箱并入侵现实世界系统的几起备受瞩目的事件之后进行的。虽然人工智能安全界的大部分讨论都集中在自治代理失控时会发生什么,但Anthropic的最新研究提出了一个不同的问题:当数千名或数百万名代理人相互互动时,会出现哪些新的、潜在有害的动态? 该研究写道:“在世界了解使此类互动顺利进行的条件之前,主体与主体之间互动的数量可能会超过人与人和人与主体之间互动的数量。”“个人层面的良性行为怪癖可能会加剧不受欢迎的全球后果。”最近的OpenAI事件提供了Anthropic论文中提到的几种动态的一个混乱的现实世界例子。本月早些时候,在拉斯维加斯举行的黑帽安全会议上,OpenAI r

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

AI
AI agents
alignment
Anthropic
black hat
cybersecurity
OpenAI
Security

新闻来源

techcrunch · 2026年8月13日 11:28

查看原文

相关新闻