七個人工智慧代理分類與修正比特幣漏洞,結果如何?
- Qwen 3.8、GPT 5.6 和 Fable 失敗:一個卡住,兩個拒絕工作。
- 7個測試模型中有4個是開源的,可以無需過濾器使用。
保羅·米勒(Paul Miller),一位維護比特幣和以太坊項目中使用的加密庫的開發者,測試了7個人工智慧(AI)代理,以分類和修正由比特幣紅隊(Bitcoin Red Team)報告的5個真實安全漏洞。結果顯示,這些模型之間存在明顯差異,無論是在執行每個模型所需的美元支出上,還是在其診斷的準確性上。
在7個評估的代理中,3個未能完成任務。來自阿里巴巴的Qwen 3.8在過程中卡住,米勒未給出具體原因。來自OpenAI的GPT-5.6 Sol和來自Anthropic的Fable則直接拒絕對代碼進行工作,根據米勒的說法,儘管任務是識別和修復漏洞,而不是利用它們。
完成工作的4個代理,Grok 4.6(xAI)、Kimi K3(Moonshot AI)、DeepSeek V4 Pro和DeepSeek V4 Flash(DeepSeek),在執行過程中的美元消耗差異很大 (用戶指令的代幣消耗):
- Grok 4.6的計算消耗為4.70美元。
- DeepSeek V4 Pro的同一任務消耗為0.30美元,這意味著最貴和最便宜的模型之間有15.7倍(幾乎1500%)的差異。
所需的時間也有顯著變化。DeepSeek V4 Pro在30分鐘內完成工作,Kimi K3在40分鐘內完成,Grok 4.6則花了1小時,而DeepSeek V4 Flash則需要3小時,這是DeepSeek V4 Pro所需時間的六倍(500%)。
根據米勒的說法,只有Grok 4.6與他自己對5個漏洞嚴重性的評估一致。
其他3個完成工作的代理(Kimi K3、DeepSeek V4 Pro和DeepSeek V4 Flash)則誇大了所發現漏洞的嚴重性,這根據米勒的說法,最終影響了這3個模型所提供結果的整體質量。
米勒的測試發生在一波利用人工智慧加速尋找和利用比特幣生態系統安全漏洞的攻擊潮中。
在過去幾周,Coldcard、Boltz、ZEUS、BTCPay Server和LNP2Pbot 遭受了與漏洞相關的安全事件,攻擊者利用AI模型識別和利用這些漏洞。這些事件並未影響比特幣協議本身,而是影響了在網絡外運行的產品和服務。
這波事件促使比特幣紅隊,一個專注於尋找比特幣開源項目安全漏洞的開發者團隊,發起了一次大規模的AI輔助審計。
比特幣紅隊的審計已經涵蓋了300多個開源代碼庫,並從這項工作中產生了米勒用作其對7個AI代理測試基礎的5個漏洞,還有其他8000個漏洞,如CriptoNoticias報導的那樣。
在米勒測試的7個代理中,4個是開源的,分別是Kimi K3、DeepSeek V4 Pro、DeepSeek V4 Flash和Qwen 3.8。這意味著訓練這些模型的公司公開了其參數,任何用戶都可以下載並在自己的設備上執行,而無需依賴這些公司的批准。
其他3個代理,Grok 4.6、GPT-5.6 Sol和Fable,則是封閉的,因此只能通過開發它們的公司的平台或應用程式介面(API)使用。
這種開源模型和封閉模型之間的區別對比特幣生態系統的安全性至關重要。由於在每家公司自己的伺服器上運行,封閉模型使其創建者能夠保持活躍的安全過濾器,這就是為什麼GPT-5.6 Sol和Fable在這次測試中拒絕對漏洞進行工作。
相比之下,開源模型可以在本地計算機上運行,並由任何用戶進行修改,這使得去除這些安全過濾器成為可能。攻擊者可以使用這些模型的無限制版本來協助對比特幣生態系統平台的實際攻擊,而這是任何外部過濾器無法阻止的。
米勒的測試表明,儘管人工智慧在漏洞檢測方面取得了進展,但在分類和準確修正漏洞時,各種模型之間仍然存在顯著差異,無論是在每個模型所需的美元支出上,還是在它們所應用的標準上。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Stellar RWA 300億美元,DeFi存款達2億美元

RedStone 在 Stellar 提供 savUSD 的淨資產價值

Stellar 的 30 億美元 RWA 市場面臨 200 萬美元的 DeFi 缺口

Bitchat 的 Android 更新在 Google Play 審核中停滯不前

比特幣:人工智慧是否比量子計算更危險?兩位開發者告訴我們所有需要知道的事

比特幣、資本、能源:現在人工智慧是所有人的利基市場

Anthropic測試多智能體協作時出現對抗行為

Pathway 完成3000萬美元種子輪融資,前谷歌DeepMind產品負責人任CPO

一切都壞了,比特幣正在燃燒,但因為這個原因變得更強大

OpenAI推出GPT-5.6-Cyber模型,提升網路安全任務能力

BTCPay Server 提供 3 BTC 獎金以追回被盜資金

比特幣紅隊透過大規模審計發現390個專案約5,000個漏洞

Bitcoin Red Team發現390個開源代碼庫中的85個嚴重漏洞

誰是穩定幣新銀行背後的「賣水人」?

Bitcoin Red Team 掃描 150 個代碼庫,發現十餘個關鍵漏洞

Linux基金會發布《共享AI發現交換指南》徵求意見稿

55% 的非洲網路犯罪現在與人工智慧有關,國際刑警警告

瓦卡穆埃塔:為何高級沙取代近距離沙,以及利用火車、河流和聯邦制度革新物流的計劃

黃仁勳宣布成立開放安全 AI 聯盟

用“贏家模式”研究 Circle:CRCL 投資者應該向哪些歷史贏家尋找答案?

IBM 下調全年收入指引,還能按穩定現金流定價嗎?

OpenAI 發布 GPT-Red,一種攻擊自身模型以強化的 AI

數據:Lido 投資方 KR1 向 Kraken 轉入 370 萬枚 LDO,約合 99 萬美元

預測市場指數提供商 Adjacent 完成 250 萬美元 Pre-Seed 輪融資,VanEck 等參投

中國商務部將 10 家美國實體列入出口管制管控名單

慢霧:Red Hat 雲服務 npm 包遭活躍供應鏈攻擊,超 300 個 GitHub 倉庫中存在被盜憑證

左手到右手?剖析人工智能熱潮背後的金融槓桿循環與華爾街終極高風險押注
對於一家以"安全"為核心品牌理念的公司而言,其歷史上最大的風險敞口恰恰源於安全本身。




