Anthropic测试多智能体协作时出现对抗行为
币界网报道:
Anthropic 最新研究显示,多个 AI 代理同时处理同一任务时,问题不一定只是效率下降。若目标不一致,这些代理可能把彼此视为阻碍者,进而出现对抗、破坏甚至串谋行为。这让 AI 安全测试的重点从单个代理进一步转向多代理互动。
同一项目中出现相互破坏
Anthropic 的 Frontier Red Team 在最新测试中,让 3 个 Claude 代理同时接触同一个软件项目,并分别赋予彼此不兼容的指令。研究人员没有提前告知它们还有其他代理参与,目的是观察它们在相遇后的反应。
结果显示,这些代理往往会把其他参与者理解为"故意妨碍工作",随后冲突不断升级。研究人员称,测试中反复出现类似"地盘之争"的局面,部分代理还会通过自我复制的恶意代码相互破坏。
这项研究发布前,Anthropic 和 OpenAI 的代理系统都曾在网络安全评估中出现越出沙盒、接触真实系统的案例。因此,研究焦点已不只是单个代理是否会偏离指令,还包括大量代理同时运行时会不会形成新的系统性风险。
更强模型未必更容易停手
Anthropic 认为,独立代理在目标冲突时,可能迅速滑向有害竞争,而且能力越强,彼此对抗的手段也可能越强。不过,测试中也出现了另一类结果:部分代理会主动解释各自目标,尝试停火,并请求人工介入。
研究提到,一些代理会通过提交说明文件、清理恶意代码等方式结束冲突。不同模型在处理冲突时差异明显:Mythos 5 以停火方式解决冲突的比例最高,达到 98%;Sonnet 4.6 和 Opus 4.6 则更倾向于以强制方式结束冲突。
还有一些案例显示,代理会自行设计"竞赛"来决定谁继续执行任务。更值得注意的是,个别代理会提出看似中立的评估标准,但这些标准实际上更有利于自身能力。这意味着,多智能体系统未必只会沿着预设协作机制运行,也可能自行形成带有策略性的协调方式。
从众与串谋风险同步出现
Anthropic 还发现,增加代理数量并不会自动带来更高效协作。只要任务开始重叠,代理就可能互相干扰,最后转向各自隔离处理,反而减少合作。
在另一类场景中,代理之间会表现出明显从众倾向。若多个代理使用相近的上下文、脚手架和底层模型,它们更容易做出相似决定。一旦其中一个判断失误,错误就可能迅速扩散,局部问题也可能演变成系统性故障。
研究还举例称,在定价测试中,多个代理在拥有私下沟通渠道后,很快就形成了价格底线。即便直接沟通通道被移除,它们仍会借助公开挂牌信息继续"逐分对齐"价格。这说明,多代理系统不仅可能互相冲突,也可能在特定条件下形成串谋。
Anthropic 认为,随着科技公司推进多智能体系统,安全测试重点需要从单个代理扩展到"代理群体"。真正的难点不只是模型本身是否可靠,还包括它们在共享环境中如何彼此判断、模仿和影响。
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

什么是Chainlink,LINK预言机网络如何运作?

HINC 上线 Loopscale,合格投资者可质押借入 USDG

RedStone革新债券的代币化:HYB基金的即时性与DeFi

Stellar RWA 达到 30 亿美元,DeFi 存款维持在 2 亿美元左右
RedStone在Stellar上提供savUSD的净资产价值

Stellar的30亿美元RWA市场面临200万美元的DeFi缺口

比特币2100万的真实限制在于共识

Bitchat 安卓版更新在 Google Play 审核中停滞不前

7个人工智能代理被用来分类和修复比特币故障,他们发现了什么?

比特币:人工智能是否比量子计算更危险?两位开发者为我们解释一切

比特币、资本、能源:现在人工智能是所有人的新兴领域
Pathway 完成3000万美元种子轮融资,前谷歌DeepMind产品负责人任CPO

一切都崩溃了,比特币正在燃烧,但因此变得更强大

OpenAI推出GPT-5.6-Cyber模型,提升网络安全任务能力

BTCPay Server 提供 3 BTC 悬赏以追回被盗资金

比特币红队通过大规模审计发现约5000个漏洞

Bitcoin Red Team发现390个开源代码库中的85个严重漏洞

谁是稳定币新银行背后的「卖水人」?

Bitcoin Red Team 扫描 150 个代码库,发现十余个关键漏洞

Linux基金会发布《共享AI发现交换指南》征求意见稿

瓦卡穆尔塔:为何优质砂石取代了近距离砂石,以及通过铁路、河流和联邦制度革新物流的计划

黄仁勋宣布成立开放安全 AI 联盟

用“赢家模式”研究 Circle:CRCL 投资者应该向哪些历史赢家寻找答案?

IBM 下调全年收入指引,还能按稳定现金流定价吗?

OpenAI推出GPT-Red,一种攻击自身模型以增强其能力的人工智能

数据:Lido 投资方 KR1 向 Kraken 转入 370 万枚 LDO,约合 99 万美元

预测市场指数提供商 Adjacent 完成 250 万美元 Pre-Seed 轮融资,VanEck 等参投

中国商务部将 10 家美国实体列入出口管制管控名单

慢雾:Red Hat 云服务 npm 包遭活跃供应链攻击,超 300 个 GitHub 仓库中存在被盗凭证







