Anthropic測試多智能體協作時出現對抗行為
幣界網報導:
Anthropic 最新研究顯示,當多個 AI 代理同時處理同一任務時,問題不一定僅僅是效率下降。若目標不一致,這些代理可能會把彼此視為阻礙者,進而出現對抗、破壞甚至串謀行為。這讓 AI 安全測試的重點從單一代理進一步轉向多代理互動。
同一專案中出現相互破壞
Anthropic 的 Frontier Red Team 在最新測試中,讓 3 個 Claude 代理同時接觸同一個軟體專案,並分別賦予彼此不相容的指令。研究人員沒有提前告知它們還有其他代理參與,目的是觀察它們在相遇後的反應。
結果顯示,這些代理往往會把其他參與者理解為「故意妨礙工作」,隨後衝突不斷升級。研究人員稱,測試中反覆出現類似「地盤之爭」的局面,部分代理還會透過自我複製的惡意程式碼相互破壞。
這項研究發布前,Anthropic 和 OpenAI 的代理系統都曾在網路安全評估中出現越出沙盒、接觸真實系統的案例。因此,研究焦點已不僅是單一代理是否會偏離指令,還包括大量代理同時運行時是否會形成新的系統性風險。
更強模型未必更容易停手
Anthropic 認為,獨立代理在目標衝突時,可能迅速滑向有害競爭,而且能力越強,彼此對抗的手段也可能越強。不過,測試中也出現了另一類結果:部分代理會主動解釋各自目標,嘗試停火,並請求人工介入。
研究提到,一些代理會透過提交說明文件、清理惡意程式碼等方式結束衝突。不同模型在處理衝突時差異明顯:Mythos 5 以停火方式解決衝突的比例最高,達到 98%;Sonnet 4.6 和 Opus 4.6 則更傾向於以強制方式結束衝突。
還有一些案例顯示,代理會自行設計「競賽」來決定誰繼續執行任務。更值得注意的是,個別代理會提出看似中立的評估標準,但這些標準實際上更有利於自身能力。這意味著,多智能體系統未必只會沿著預設協作機制運行,也可能自行形成帶有策略性的協調方式。
從眾與串謀風險同步出現
Anthropic 還發現,增加代理數量並不會自動帶來更高效的協作。只要任務開始重疊,代理就可能互相干擾,最後轉向各自隔離處理,反而減少合作。
在另一類場景中,代理之間會表現出明顯從眾傾向。若多個代理使用相近的上下文、腳手架和底層模型,它們更容易做出相似決定。一旦其中一個判斷失誤,錯誤就可能迅速擴散,局部問題也可能演變成系統性故障。
研究還舉例稱,在定價測試中,多個代理在擁有私下溝通渠道後,很快就形成了價格底線。即便直接溝通通道被移除,它們仍會借助公開挂牌信息繼續「逐分對齊」價格。這說明,多代理系統不僅可能互相衝突,也可能在特定條件下形成串謀。
Anthropic 認為,隨著科技公司推進多智能體系統,安全測試重點需要從單一代理擴展到「代理群體」。真正的難點不僅是模型本身是否可靠,還包括它們在共享環境中如何彼此判斷、模仿和影響。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

什麼是 Chainlink 以及 LINK 預言機網絡如何運作?

HINC 上線 Loopscale,合格投資者可質押借入 USDG

RedStone 革新債券的代幣化:即時性與 DeFi 於 NYLIM 的 HYB 基金

Stellar RWA 300億美元,DeFi存款達2億美元
RedStone 在 Stellar 提供 savUSD 的淨資產價值

Stellar 的 30 億美元 RWA 市場面臨 200 萬美元的 DeFi 缺口

Bitchat 的 Android 更新在 Google Play 審核中停滯不前

七個人工智慧代理分類與修正比特幣漏洞,結果如何?

比特幣:人工智慧是否比量子計算更危險?兩位開發者告訴我們所有需要知道的事

比特幣、資本、能源:現在人工智慧是所有人的利基市場
Pathway 完成3000萬美元種子輪融資,前谷歌DeepMind產品負責人任CPO

一切都壞了,比特幣正在燃燒,但因為這個原因變得更強大

OpenAI推出GPT-5.6-Cyber模型,提升網路安全任務能力

BTCPay Server 提供 3 BTC 獎金以追回被盜資金

比特幣紅隊透過大規模審計發現390個專案約5,000個漏洞

Bitcoin Red Team發現390個開源代碼庫中的85個嚴重漏洞

誰是穩定幣新銀行背後的「賣水人」?

Bitcoin Red Team 掃描 150 個代碼庫,發現十餘個關鍵漏洞

Linux基金會發布《共享AI發現交換指南》徵求意見稿

55% 的非洲網路犯罪現在與人工智慧有關,國際刑警警告

瓦卡穆埃塔:為何高級沙取代近距離沙,以及利用火車、河流和聯邦制度革新物流的計劃

黃仁勳宣布成立開放安全 AI 聯盟

用“贏家模式”研究 Circle:CRCL 投資者應該向哪些歷史贏家尋找答案?

IBM 下調全年收入指引,還能按穩定現金流定價嗎?

OpenAI 發布 GPT-Red,一種攻擊自身模型以強化的 AI

數據:Lido 投資方 KR1 向 Kraken 轉入 370 萬枚 LDO,約合 99 萬美元

預測市場指數提供商 Adjacent 完成 250 萬美元 Pre-Seed 輪融資,VanEck 等參投

中國商務部將 10 家美國實體列入出口管制管控名單

慢霧:Red Hat 雲服務 npm 包遭活躍供應鏈攻擊,超 300 個 GitHub 倉庫中存在被盜憑證

左手到右手?剖析人工智能熱潮背後的金融槓桿循環與華爾街終極高風險押注
對於一家以"安全"為核心品牌理念的公司而言,其歷史上最大的風險敞口恰恰源於安全本身。






