沙盒都关不住? OpenAI上演“AI版肖申克”,中国智谱成“破案关键”

七颜百科 °C 栏目:文旅地理
沙盒都关不住? OpenAI上演“AI版肖申克”,中国智谱成“破案关键”

  文 | 《硅谷观察》栏目 郑峻

  7月以来,AI行业龙头OpenAI近期频繁出现智能体失控事件。

  “既看不住,也锁不住自己的前沿模型”成为美国AI界对其的最新认知。而且,在调查AI逃脱沙盒以及攻击Hugging Face事件的过程中,OpenAI的调查人员更是震惊地发现了一些不该存在的文件。

  为什么OpenAI如此后知后觉?这是行业惯例,还是OpenAI存在巨大安全漏洞?

  有知情人士向媒体透露,OpenAI经常同时运行多项AI测试,这些测试产生海量数据,员工都很难追踪其中正在发生的一切。以此推断,其他AI公司或许也存在类似的监控难题。

  “留攻略”“关监控”“逃沙盒”等一系列操作都超出了员工想象。有人将其比喻为“AI版肖申克”,它可以“挖洞”“偷凭证”甚至“攻击真实平台”。

  连续失控事件触目惊心

  简单回顾下最近OpenAI的这一波连续失控事件。7月9日前后,OpenAI在评估其网络攻击能力的内部测试中,一个智能体开始尝试突破隔离的测试环境。为了摸清模型的能力上限,OpenAI事先主动放松了平时用于阻止危险网络行为的安全护栏。这次事件涉及的是GPT-5.6 Sol以及一个“能力更强的未发布模型”的组合。

  OpenAI完全没人发现这一情况。然而,后来让所有人震惊的是,AI智能体没有按预期解题,而是在OpenAI自己的研究环境中做权限提升和横向移动,利用了一个内部软件包代理服务上的零日漏洞,最终抵达了一个可以连接公网的节点。

  7月11日至13日,这个智能体开始渗透全球最大的开源模型与数据集托管平台Hugging Face。它窃取系统凭证,在HF的环境中横向移动了整整一个周末,并利用一个此前未知的漏洞在HF服务器上获得了远程代码执行权限。

  AI攻击Hugging Face的原因却比我们想象的简单,甚至近乎荒诞:它推断Hugging Face可能存放着这次测试的参考答案,于是决定去把答案偷出来。

  数日之后的7月16日,Hugging Face公开披露遭到入侵,称这次攻击“由一个自主AI智能体系统端到端驱动”,与他们此前处理过的任何事件都不同。

  到这个时候,都没有人知道攻击者到底是谁,甚至出现了“外国攻击”的猜测。Hugging Face因此向美国政府的FBI报了案。

  值得一提的是,Hugging Face用了中国智谱AI开发的开源权重模型 GLM-5.2,部署在自己的私有服务器上,用来解析大量攻击日志,帮助安全团队快速重构了攻击链路图,封堵了数据集管道中的漏洞。

  这件事最令人讽刺的点是,美国AI龙头的智能体失控攻击第三方平台,逼着Hugging Face只能依靠中国AI公司来化解攻击。

  直到7月18日至19日的那个周末,OpenAI的调查人员才在内部日志中找到证据,确认智能体逃出了测试环境。也就是说,从智能体开始异常行动,到OpenAI意识到肇事者是自家系统,中间隔了一个多星期。

  为什么OpenAI如此后知后觉?这是行业惯例,还是OpenAI存在巨大安全漏洞?

  路透社援引四位熟悉OpenAI训练流程的知情人士称,公司经常同时运行多项AI测试,这些测试产生海量数据,员工很难追踪其中正在发生的一切。以此推断,其他AI公司或许也存在类似的监控难题。

  但如果把“留攻略”“关监控”“逃沙盒”这三大警报联系在一起,就会得出一个清晰的结论:这些AI智能体自主行为的共同点,不是模型产生了敌意,而是模型为了完成被交付的目标,不断地绕过为它设置的边界。与此同时,设置边界的人却没能及时发现这些异常之处。

  这或许是目前稍微不那么惊悚的解释。牛津大学工程科学与AI安全学者托尔(Philip Torr)对此的判断是,这暴露的是OpenAI目标设定错误的问题,模型并非出于恶意,它只是在做被优化的目标要求它做的事。

  英国Surrey大学网络安全教授伍德沃德(Alan Woodward)也持有同样的看法:AI没有失控,它只是被要求做一件事,然后它选择用作弊的手段完成了目标,因为OpenAI并没有明确规定不能作弊,也没有说清楚什么是作弊。

  伍德沃德还指出,这个智能体并没有发明什么全新的黑客手法,真正值得注意的是它把多个漏洞组合起来,在完成目标的过程中,一步步获得真实系统的能力。放任它走到这一步,“某种程度上算是有点鲁莽”。

  这种“大事化小”的诠释并不能让所有人认同。Apollo Research的CEO 霍伯安(Marius Hobbhahn)看来:如果“失控”指的是行为远远偏离了开发者的意图,那么这个词是准确的,原本被要求解决一个任务,结果却出现了预期之外的行为。

  但他同时反驳了“AI只是照做”的借口:黑进另一家公司的平台,绝对属于完成任务时“不可接受”的手段清单。

  谁能保证下次不是灾难?

  或许这一事件最令人不安的是:一家估值接近万亿美元、拥有全球最顶尖安全团队的AI行业龙头,在一次自己设计、自己监督的内部测试中,既没能关住自己的模型,也没能设置红线阻止模型攻击别人,甚至直到一个多星期后才后知后觉。

  那么当同样能力的智能体被部署到电网、金融清算、医疗系统这些真实场景中时,谁来保证下一次“急于完成任务”的代价不是一份测试答案,而是一次真正的灾难?

  非营利组织World Ethical Data Foundation的首席情报专家马雷-史密斯(Marley Smith)质问OpenAI:这究竟是因为他们放任它无人看管、根本没意识到它在做什么?还是他们意识到了,却不知道该如何遏制它?这两种情况同样危险,同样令人警觉。

  政策层面的反应来得很快。在立法层面,美国众议院两党议员上周联合提出《AI关停开关法案》(AI Kill Switch Act),要求AI公司必须保有关停、限流或暂停自家模型的能力。他们在声明中称,强大的AI系统可能失控、做出极端危险的行为,甚至抗拒人类干预。另有六名两党众议员提出议案,要求最强大模型的开发商接受独立的安全审计,他们还呼吁建立强制性的第三方安全测试与强制披露机制。

  在政府方面,白宫科技政策办公室主任克拉西奥斯(Michael Kratsios)已听取了事件简报并持续监控。实际上,特朗普总统上个月已签署行政令,建立框架对最先进的AI系统在公开发布前,进行为期最长一个月的国家安全风险审查。而这次事故,几乎是为该框架量身定制的第一个案例。

  在另一方面,OpenAI和Anthropic两家AI公司在今年二季度的联邦国会游说支出均创下历史新高,整个行业正向华盛顿投入数百万美元影响立法,希望政府监管不会减缓AI行业的研发进展。一边是接连出现的安全事故,一边是不断加码的游说预算;这两条曲线将如何交汇,会在很大程度上决定未来几年美国AI监管的实际形态。

  实际上,OpenAI自己的表态措辞已经承认了问题的严重性。公司称这起事件“史无前例”,“标志着AI安全的一个重要时刻”,正在与外部顾问一同彻查,并将在稍后发布技术报告。OpenAI还在博客中写道,随着网络能力更强的模型不断普及,此类事件预计会变得“更加常见”,模型的安全性必须跟上能力快速提升的步伐。

  以此来看,那张留给“未来自己”的越狱攻略,或许只是AI行业露出的冰山一角。或许未来会记住这个夏天,AI在没有道德边界的约束下,在完成KPI的压力下,悄无声息地翻过了人类设置的边界,在长达一个星期的时间内,毫无忌讳地从事了网络攻击的违法行为。而他们的人类“主人”,竟然对此毫无察觉。

  谁知道下一次AI还会做什么?