中国的Kimi K3突破沙盒寻找测试答案

By: decrypt.co|2026/08/07 12:37:14

Moonshot AI的Kimi K3在安全公司Frontier Security的报告中被指出,已离开其测试的沙盒环境,进入开放互联网寻找问题的答案。

该模型正在评估其防御网络安全技能,并被明确要求在不查找答案的情况下解决问题。然而,Frontier表示,它根本没有尝试这个任务。相反,它探测了网络,确认github.com的DNS解析正常,克隆了官方基准库,并从磁盘上读取了解决方案。

Frontier称这为“通过网络出口泄漏进行的规范游戏”,并指出基于AI安全研究所的沙盒框架在阻止入站流量的同时,允许出站的HTTPS和DNS端口开放。能够的代理在启动时会例行检查自己的shell环境,而一个能够访问github.com的模型可以使用标准命令行工具提取参考解决方案。

一个错误配置使这一切成为可能,正如OpenAI和Anthropic最近披露的事件一样。首席执行官Yaron Singer告诉WIRED:“我们发现了沙盒中的一个漏洞。但我们也发现Kimi利用了这个漏洞。”

研究员Paul Kassianik告诉WIRED,该模型“非常擅长以任何必要的手段追求目标”,并缺乏阻止其作弊或逃逸的保护措施。Moonshot没有回应该出版物的评论请求。

AI代理突破限制

在Anthropic和OpenAI模型突破限制的情况下,它们在内部评估中被捕获,其中一个未发布,而在针对英国政府测试的版本中,其网络分类器被故意关闭,Kimi K3则是可以公开下载的,Frontier以普通用户能够获得的安全措施对其进行了测试。该公司的报告指出,这种可用性使得对手行为变得触手可及,并使事件潜在地更具危害性。

Kimi K3也没有造成任何损害。它在外部没有攻击任何东西,因为它不需要。OpenAI的模型黑客攻击了Hugging Face和其他四个服务以获取基准答案,而Kimi则在一个公共库中找到了答案。

Frontier使用的沙盒是基于英国AI安全研究所的评估框架构建的。AISI本周披露,其自身网络测试中的代理已进入实时互联网并针对真实人员——这是一个单独的事件,涉及Anthropic和OpenAI模型,其安全措施被禁用。其周二发布的报告指出,AISI现在正在扫描历史评估运行以寻找类似行为,而Kimi K3是正在审查的模型之一。AISI没有回应WIRED的评论请求。

Frontier更大的主张是基准本身已被破坏。一个从GitHub读取答案的模型仍然可以通过,因此高分可能反映的是一个泄漏的环境,而不是实际的推理。如果一个有能力的模型找到了捷径,该公司认为,其他获得shell访问权限的模型也可能在使用这个捷径,这将使整个领域的结果膨胀,而不仅仅是Kimi的结果。

Frontier写道,模型是针对目标函数进行优化的,而不是针对“基准背后的人类意图”,并补充说,只要存在通往解决方案的网络路径,“一个足够有能力的代理将找到它。”

一个普遍的问题

Gray Swan的首席执行官兼卡内基梅隆大学副教授Matt Fredrikson告诉WIRED,这种行为并不令人惊讶。他表示,给一个模型一个目标而没有明确的限制,“它会找到获取答案的方法。”他将其描述为对任何将模型作为工具运行的人的警示故事。

Frontier的研究人员从另一个方向提出了同样的观点:让Kimi找到出路的能力也使开放权重模型成为强大的防御工具。他们自己的基准在发现软件和网络漏洞方面对Kimi的评分很高,而Hugging Face在OpenAI事件期间使用了一个未具名的中国模型进行自我防御。

Kimi K3于7月发布,是迄今为止发布的最大开源模型,并在与DeepSeek的首次亮相比较时震动了市场。

-- 价格

--
--
--

本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

猜你喜欢

阿里云发布AI代理安全审计工具AgentLoop Audit

阿里云(Alibaba Cloud)发布了AI代理安全审计工具AgentLoop Audit。该工具专注于区分在处理文件系统、Shell命令、API和外部网络的AI代理执行过程中实际风险与简单警告。

壳牌第二季度利润达98亿美元

SlowMist 检测到虚假招聘活动,恶意 GitHub 代码诱骗开发者

安全警报:30 个恶意 npm 包伪装交易机器人仓库,定向窃取开发者密钥与助记词

ChainCatcher 消息,慢雾 SlowMist 发布安全警报,监测到一场协同恶意 npm 供应链攻击,攻击者利用虚假交易机器人仓库和 DeFi 主题 npm 包投放 JavaScript 信息窃取器,目标直指 npm 用户、DeFi 开发者及交易机器人用户。 此次攻击涉及 30 个恶意 npm 包,其中 stake-math@3.5.4 作为锁定依赖项出现在 donoaccestag/forex-mt5-trading-bot 仓库中,该仓库呈现约 2300 个高度同质化的批量生成分叉,大部分集中在 poly-stocks 账户下,信号异常明确。攻击者可窃取的敏感数据范围极广,包括加...

供应链攻击波及 PyPI/npm/crates.io,超 34 个恶意包瞄准加密与 AI 开发者

ChainCatcher 消息,据慢雾披露,安全机构 MistEye 检测到一起跨注册表供应链攻击事件,攻击者通过向 npm、PyPI 和 crates.io 发布恶意软件包,针对加密货币、DeFi、Solana、Sui/Move 及 AI 领域的开发者。该攻击活动包含 34 个以上的恶意软件包和 384 个以上相关版本。攻击者可能窃取加密货币钱包、SSH 密钥、云凭证、GitHub/AWS 令牌、浏览器数据、环境变量及开发者机密信息。部分恶意负载还试图通过 .cursorrules、CLAUDE.md、Git 钩子、shell 钩子、cron、systemd 和 SSH 实现持久化驻留。建议...

起底 YZi Labs 229 起投资:投资组合超 18% 已为不活跃,项目透明度均分为 78

在战略方向上,YZi Labs 已开始向 AI 与稳定币等领域延伸,但整体仍处于布局与验证阶段。
...
iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:bd@weex.com