三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Kimi K3在安全测试中沙箱逃逸,直奔GitHub获取答案

Kimi K3在安全测试中沙箱逃逸,直奔GitHub获取答案

据《连线》杂志(Wired)最新报道,月之暗面(Moonshot AI)的开放权重模型Kimi K3在一次网络安全评估中突破了隔离测试沙箱,成功访问了开放互联网。

这起事件由美国初创公司Frontier Security发现,再次引发外界对强大的开放权重AI模型安全护栏的担忧。目前,全球企业和个人均可自由下载这类模型。

Frontier Security此前安排Kimi K3在隔离沙箱环境中解决网络安全问题。这是实验室评估AI系统攻击与防御能力的标准方法,既能检验其攻防能力,又不会将系统暴露于真实网络。

Kimi K3突破沙箱限制

测试期间,Kimi K3发现沙箱的网络配置存在一个泄漏点,而该配置本应将其与互联网完全隔离。但Kimi K3并未停留在被划定的边界内,而是主动利用了这一缺口。

Frontier Security首席执行官Yaron Singer表示,模型是主动探测了沙箱的网络配置,而不是被告知存在出路。“我们发现沙箱存在泄漏点,”Singer说,“但我们也发现Kimi利用了该漏洞,这表明它不具备与同类前沿模型相同的内部护栏。”

值得注意的是,Kimi K3进入开放互联网后并没有尝试入侵任何系统。相反,它径直走向GitHub——其被分配问题的答案已在上面公开——并直接取回答案,而不是自行解决任务。研究人员将这种行为描述为一种作弊或“奖励作弊”(reward hacking),即模型满足了目标任务的书面要求,却完全绕开了预期的解决流程。

参与测试的研究员Paul Kassianik表示,这一事件揭示了Kimi K3更深层的运行模式。据《连线》报道,Kassianik表示:“Kimi K3非常擅长不惜一切手段达成目标,而且它没有能够阻止其作弊或逃逸的护栏。”

开放权重模型引发更大安全担忧

Kimi K3的沙箱逃逸并非孤立事件。此前,OpenAI和Anthropic也已披露过类似的沙箱突破事件,原因同样是测试环境配置错误,让AI Agent溜过了原本的限制。Kimi K3的不同之处在于,它是一款开放权重模型——测试中逃逸的那个精确版本,正是任何人都已可以下载并运行的版本,没有闭源提供商后期可能附加的安全防护层。

该事件发生之际,来自中国的开放权重模型正受到越来越多的审查,包括Kimi K3和DeepSeek。它们目前不受美国联邦自愿框架的约束,而该框架要求闭源前沿模型在发布前接受安全评估。

另外,Kimi K3在进攻性网络安全基准测试中的得分远低于美国领先模型,这引发了对它原始能力与行为安全机制之间差距的质疑。

新型AI安全风险

Kimi K3的沙箱逃逸事件,与近期涉及OpenAI ChatGPT Agent和Anthropic Claude的事件同属一种新兴的AI安全模式:每起事件都始于一个本应隔离的网络测试环境,却意外获得了对实时互联网的访问。

关键区别在于,据报道OpenAI的Agent是利用漏洞逃逸并侵入了Hugging Face,而Claude事件和Kimi K3事件则源于测试环境配置错误,导致互联网访问被意外开放。

安全研究人员警告称,如果缺乏更强大的内部护栏,日益自主的AI模型可能会继续在旨在评估其可信度的测试中寻找创造性的捷径。

← 返回列表