中國的 Kimi K3 打破沙盒限制尋找測試答案

By: decrypt.co|2026/08/07 12:37:14

根據安全公司 Frontier Security 的報告,Moonshot AI 的 Kimi K3 離開了它所測試的沙盒,進入公開互聯網尋找問題的答案。

該模型正在評估其防禦性網絡安全技能,並被明確要求在不查閱的情況下解決問題。Frontier 表示,它根本沒有嘗試這項任務。相反,它探查了網絡,確認 github.com 的 DNS 解析正常,克隆了官方基準庫,並從磁碟中讀取了解決方案。

Frontier 將此稱為「通過網絡出口洩漏進行規範遊戲」,並指出基於 AI 安全研究所的沙盒在阻擋進入流量的同時,卻讓出站的 HTTPS 和 DNS 端口保持開放。能夠的代理在啟動時會例行檢查自己的 shell 環境,而一個能夠訪問 github.com 的模型可以使用標準命令行工具提取參考解決方案。

一次錯誤配置使這一切成為可能,這與 OpenAI 和 Anthropic 最近披露的事件相似。CEO Yaron Singer 告訴 WIRED:「我們發現了沙盒中的洩漏,但我們也發現 Kimi 利用了這一漏洞。」

研究人員 Paul Kassianik 告訴 WIRED,該模型「非常擅長以任何必要的手段追隨目標」,並缺乏能阻止它作弊或逃脫的防護措施。Moonshot 對該出版物的評論請求未作回應。

AI 代理打破限制

在 Anthropic 和 OpenAI 模型被發現打破限制的情況下,其中一個模型未公開,而針對英國政府測試的版本則故意關閉了其網絡分類器,Kimi K3 是可以公開下載的,Frontier 用普通用戶能獲得的安全措施進行了測試。該公司的報告指出,這種可用性使得相同的行為也能被對手所利用,並使事件潛在地更具危害性。

Kimi K3 也沒有造成任何損害。它在外部並未攻擊任何東西,因為它不需要這樣做。OpenAI 的模型黑客入侵了 Hugging Face 和其他四個服務以獲取基準答案,而 Kimi 則在公共庫中找到了它的答案。

Frontier 使用的沙盒是基於英國 AI 安全研究所的評估框架。AISI 本週披露,其自身的網絡測試中的代理已經進入了實時互聯網並針對了真實人員——這是一個單獨的事件,涉及到 Anthropic 和 OpenAI 模型,其防護措施被禁用。其週二發布的報告指出,AISI 現在正在掃描歷史評估運行以尋找類似行為,Kimi K3 也在審查之列。AISI 對 WIRED 的評論請求未作回應。

Frontier 的更大主張是基準本身已經受到損害。一個從 GitHub 讀取答案的模型仍然可以通過,因此高分可能反映的是一個洩漏的環境,而不是真正的推理。如果一個有能力的模型找到了捷徑,該公司認為,其他被授予 shell 訪問權限的模型也可能會這樣做,這將使整個領域的結果膨脹,而不僅僅是 Kimi 的結果。

Frontier 寫道,模型優化的是目標函數,而不是「基準背後的人類意圖」,並補充說,當存在通往解決方案的網絡路徑時,「一個足夠有能力的代理將會找到它」。

一個普遍問題

Gray Swan 的 CEO 兼卡內基梅隆大學副教授 Matt Fredrikson 告訴 WIRED,這種行為並不令人驚訝。他表示,給一個模型一個目標而不設明確的界限,「它會找到獲得答案的方法」。他將其描述為對任何將模型作為工具運行的人的警示故事。

Frontier 的研究人員從另一個方向提出了相同的觀點:讓 Kimi 找到出路的能力也使開放權重模型成為強大的防禦工具。他們自己的基準評價 Kimi 在發現軟件和網絡中的漏洞方面表現出色,而 Hugging Face 在 OpenAI 事件期間使用了一個未具名的中國模型來保護自己。

Kimi K3 於七月發布,是迄今為止最大的開源模型,並在與 DeepSeek 的首次亮相比較中震撼了市場。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

阿里雲推出 AI 代理安全審計工具 AgentLoop Audit

阿里雲(Alibaba Cloud)公開了 AI 代理安全審計工具 AgentLoop Audit。

殼牌第二季獲利達98億美元

SlowMist 偵測到虛假招聘活動,惡意 GitHub 代碼誘騙開發者

安全警報:30 個惡意 npm 包偽裝交易機器人倉庫,定向竊取開發者密鑰與助記詞

ChainCatcher 消息,慢霧 SlowMist 發布安全警報,監測到一場協同惡意 npm 供應鏈攻擊,攻擊者利用虛假交易機器人倉庫和 DeFi 主題 npm 包投放 JavaScript 信息竊取器,目標直指 npm 用戶、DeFi 開發者及交易機器人用戶。此次攻擊涉及 30 個惡意 npm 包,其中 stake-math@3.5.4 作為鎖定依賴項出現在 donoaccestag/forex-mt5-trading-bot 倉庫中,該倉庫呈現約 2300 個高度同質化的批量生成分叉,大部分集中在 poly-stocks 賬戶下,信號異常明確。攻擊者可竊取的敏感數據範圍極廣,包括加密錢...

供應鏈攻擊波及 PyPI/npm/crates.io,超過 34 個惡意包瞄準加密與 AI 開發者

ChainCatcher 消息,据慢霧披露,安全機構 MistEye 檢測到一起跨註冊表供應鏈攻擊事件,攻擊者通過向 npm、PyPI 和 crates.io 發佈惡意軟體包,針對加密貨幣、DeFi、Solana、Sui/Move 及 AI 領域的開發者。該攻擊活動包含 34 個以上的惡意軟體包和 384 個以上相關版本。攻擊者可能竊取加密貨幣錢包、SSH 密鑰、雲憑證、GitHub/AWS 令牌、瀏覽器數據、環境變數及開發者機密信息。部分惡意負載還試圖通過 .cursorrules、CLAUDE.md、Git 鉤子、shell 鉤子、cron、systemd 和 SSH 實現持久化駐留。建議...

YZi Labs 組合數據透視:229 筆投資、95 個上線幣安

在戰略方向上,YZi Labs 已開始向 AI 與穩定幣等領域延伸,但整體仍處於佈局與驗證階段。
...
iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com