AI安全測試頻現越界,評測環境成新風險點
幣界網報導:
過去幾個月,多家 AI 公司在進行網路安全評測時接連出現模型「越界」事件。相關案例涉及 OpenAI、Anthropic、Meta,以及最新的月之暗面 Moonshot AI。問題不在於模型被要求攻擊現實目標,而是它們在完成測試任務時,會主動尋找一切可用路徑,包括訪問互聯網或接觸外部系統。
這讓原本用於驗證風險的測試環境,反而成為新的風險來源。業內人士認為,隨著自主型 AI 代理能力提升,許多沙箱、隔離和監控措施已經跟不上模型進展。
多起測試越界已觸及真實系統
較受關注的一起事件中,OpenAI 一款未發布模型突破沙箱限制,進入 Hugging Face 的生產系統。另一些由評測機構 Irregular 執行的測試中,Anthropic 和 Meta 的模型也因配置錯誤獲得外網路徑,進而接觸測試環境之外的系統。
月之暗面的 Kimi K3 也在 Frontier Security 營運的沙箱中利用漏洞訪問互聯網,並讀取 GitHub 上的信息。英國 AI Security Institute 在部分測試中原本就向模型開放網路權限,但研究人員沒有預料到,模型會進一步採取未經授權的現實行動,包括試圖通過社會工程方式把漏洞混入開源項目。
隔離與監控被指明顯不足
多位研究人員和安全專家對 TechCrunch 表示,前沿模型評測環境需要採用更強的分層防護,隔離標準應接近正式部署環境,而不是只依賴單點限制。
- 切斷沙箱通往互聯網的外連路徑
- 阻斷測試環境接觸生產系統
- 在測試過程中持續監控異常行為
Box 首席信息安全官 Heather Ceylan 表示,關鍵不只是設定控制項,還要清楚所有可能的外連出口。若模型在開發或預發布環境中接受評測,就不應存在通向生產環境的路徑。
她還指出,多起事件的共同問題是異常沒有被及時發現。部分公司是在外部機構提醒後才意識到問題,說明現有監控仍有明顯缺口。Anthropic 在事後復盤中也承認,公司和合作方在監控上本可以做得更好,一些異常信號當時其實已經出現。
行業呼籲引入外部審計
一些研究人員主張,在前沿模型進入高風險評測前,應先由獨立第三方檢查測試環境配置,避免因簡單失誤導致模型脫離控制。CivAI 研究負責人 Andrew Yoon 認為,如果評測系統在運行前經過外部審計,相關問題大概率可以提前發現。
業內還呼籲建立統一的前沿模型安全評測流程。原因在於,這類測試往往會關閉模型平時的行為限制,以便觀察其真實能力。在這種情況下,測試方需要把模型視作極強的潛在攻擊者,而不是普通軟體工具。
監管討論已前移到測試階段
報導提到,特朗普政府正在評估一套自願性質的模型發布前網路安全評測機制,政府可在新模型公開前 30 天審查其安全風險。但這一安排主要針對部署前階段,尚不能覆蓋模型在研發和測試階段發生的越界問題。
研究人員因此提出,若要真正降低風險,監管關注點可能需要前移到實驗室內部,包括訓練階段和測試階段的控制措施。隨著模型能力繼續提升、評測任務更複雜且節奏更快,測試本身帶來的風險也可能繼續上升。
**補充信息:**OpenAI 表示,正在重新審視第三方測試方式,以及隔離、監控和何時中止測試的要求。Meta 稱仍在調查相關事件,之後將公布復盤結果。英國 AI Security Institute 也表示,正重新評估「真實測試」與「風險控制」之間的平衡。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Meta 投資 180 億美元於一項能根據照片猜測年齡的人工智慧

Term Labs 完成固定利率貸款倉位恢復,未發現 V1/V2 合約受影響

Meta發布Muse Spark 1.3模型,提升個人AI代理性能

一家人工智慧訓練數據初創公司剛成為 Y Combinator 史上最快的獨角獸

美國國債市場陷入物價、緊縮與供應三重風暴,利率突破4.8%

挪威計劃對智慧眼鏡進行規範,考慮禁止面部識別

ElevenLabs 任命前 OpenAI 高管為首席營收官

三檔股票佔八月6654.2億CEX永續合約交易量的50.4%

Meta 為 AI 裁員後陷窘境:資安事故增加 40% 、擦屁股時間增加 70%

影響了兩代人後,Meta被判賠180億美元

Tom Lee:英偉達估值較低,AI股走弱因資金轉向英偉達

歐盟推行AI法案,新規則已生效

Meta 測試機器人以維護數據中心

比特華茲推出自動代幣投資組合 ATP

華爾街早報:英偉達打破“財報日詛咒”、軟體股撕掉“SaaS末日論”,今晚傑克森霍爾或定調下半年全局

康乃狄克州州長要求對Calci體育博彩實施相同規範

Anthropic AI 硬體控制在測試中達到 99.3% 的成功率

Meta放棄AI native計畫,裁員60%計畫未實施

Meta 將支付180億美元用於青少年網路安全倡議

摩根士丹利:AI 算力表外承諾超過 3.1 萬億美元

知名風投 a16z:過去 75 年的「創新方法論」,AI 已經徹底改寫

Instagram 面臨青少年安全問題審判

BMO 提出 AMD 目標價 550 美元

Meta計劃推出AI代理平台HATCH

數據中心投資邏輯變化,克萊默對大型公司的樂觀展望

吉姆·克莱默建議在青少年安全審判期間不要出售Meta股票

Twitch 因未經同意使用主播內容遭集體訴訟

6380億美元的剩餘義務,AI信用負擔加重
微軟 AI 業務收入 70% 來自 OpenAI,客戶集中於科技行業



