正当华盛顿与近200家硅谷企业激辩开放权重模型安全风险的时候,OpenAI“认领”了上周Hugging Face智能体攻击事件的“幕后黑手”。
嫌疑对象,正是GPT-5.6 Sol,以及一个尚未公开、能力更强的内部模型。
但这件事真正值得关注的,并不是AI突然产生了“攻击欲望”,而是模型能力正在跨越一个新的阈值。它们开始具备的能力,像攻击者一样长期探索环境、寻找漏洞并完成复杂目标。换言之,在长程能力不断提升的基础上,AI网络攻击能力出现了“涌现”的迹象。
OpenAI承认,这次行为至少涉及三个此前未知的安全漏洞,其中包括OpenAI研究环境和Hugging Face基础设施中的漏洞。当时,这些模型正在高度隔离的内部环境中进行网络能力基准测试。但它们太想“上进”了,不惜作弊,采取超出预期的策略,甚至发动自主网络攻击,在Hugging Face上寻找该社区托管的这项基准测试的“答案”。
这与Hugging Face此前怀疑发起这起自主攻击的智能体,“似乎构建于一个智能体安全研究Harness之上”相一致。Hugging Face联合创始人相信OpenAI没有主观恶意。
当时,Hugging Face希望借助美国本土前沿模型能力分析这起AI攻击,结果被不分善恶地拒之门外,转而采用了部署在自有基础设施上的GLM-5.2。在最新的声明中,OpenAI委婉地表示,当双方团队接触时,对方已经开始使用自己的开放权重模型进行遏制和取证重建,不过,事后已将Hugging Face纳入受信任访问计划。
这正暴露出当前AI治理中的一个新矛盾。限制前沿模型访问,可能降低风险扩散速度,即控制和避免了让“坏人”获得攻击能力;但与此同时,也可能让安全能力本身变得稀缺,即让“好人”无法及时获得防护能力。
用户名单正在成为美国应对模型治理的新工具。OpenAI的受信任访问计划,以及Anthropic的玻璃之翼计划都是如此。其中OpenAI的名单已经与美国政府共享。于是,政府不必直接写一条全国性禁令,只要决定哪些客户能先用,哪些客户不能用,就可以控制模型扩散速度。这种机制实际上形成了一种新的能力分配方式。
但这次Hugging Face的遭遇证明它过于僵化了。它没有提前阻止风险,反而加剧了解决风险的难度。今天被加入白名单的Hugging Face,未来可以获得前沿模型支持;但更多类似企业,可能仍然无法在关键时刻获得同等级能力。
于是,一个新的问题出现了。未来,在中国以外的市场,不仅智能可能向少数大型企业集中,安全能力也可能向少数拥有资格的机构集中。
这导致一个更深层的问题。当最先进AI能力只能在少数大型企业和受监管机构之间流动时,AI发展的扩散逻辑可能发生变化。如果能力集中速度超过应用普及速度,资本市场期待的广泛生产力革命,反而可能缺少足够多的真实落地点。某种程度上,这反而有点助推AI泡沫的积聚。
这也是为什么,Hugging Face事件不能被看作一次孤立事故。随着智能体从“回答问题”走向“自主执行任务”,AI网络安全风险正在从理论上的可能性,逐渐变成现实中的治理问题。未来,需要同时建立宏观治理框架与微观技术防护体系。
与科幻式的AI失控导致“末日危机”不同,随着AI能力的提升,尤其是长程任务执行能力增强,网络攻击能力正在出现类似“涌现”的迹象。
根据Epoch AI对模型网络安全能力的跟踪,在去年底之前,大型语言模型的网络安全能力基本沿着既有趋势稳步提升;但从Opus 4.5开始,前沿模型能力曲线逐渐偏离此前趋势,尤其是Mythos与GPT-5.6 Sol的出现,使模型在漏洞发现、攻击链构建和复杂环境渗透方面实现明显跃升。
(来源:EpochAI。Cyber EC为其评估多项网络安全能力基准的综合指标)而据英国人工智能安全研究所(AISI)的测评,在狭义网络安全能力上,开放权重模型与前沿闭源模型之间的差距,也正在快速缩小,从2025年的-10个月,缩短至如今的4-7个月。这项研究尚未囊括更新的Kimi K3等模型。
这并不意味着传统安全机制失效,也不意味着安全只能依赖监管机构的限制。OpenAI在解释此次事件时称,过去的安全防护主要围绕单个操作进行拦截,但对于持续运行数小时、数天甚至更久的智能体而言,每一步行为可能都符合规则,组合起来却可能导向不被允许的结果。
这意味着,就技术而言,未来安全治理不仅需要判断“某个行为是否被允许”,更需要理解“这一系列行为正在走向什么目标”。
而对于中国开放权重模型阵营而言,除了遵循监管要求,也仍然可以主动承担更多安全责任。
某种意义上,这一次,它“拯救”了Hugging Face,未来或许也将帮助更多在关键时刻被白名单拒之门外的美国企业。这也是为何此次硅谷200多家企业,包括Proton和Y Combinator,主动呼吁特朗普政府不要切断这层关系,否则将可能严重阻碍下一代美国初创企业的发展。
作为全球开放权重模型的重要提供者之一,中国模型厂商有必要建立更宏观的评估标准与行业共识,衡量开放权重模型在推动智能普惠过程中创造的价值增益,以及伴随能力扩散产生的安全成本。同时,在技术上也需要发展更精细的风险归因机制,区分风险究竟来源于模型本身、部署环境中的安全防护不足,还是下游使用者的不当应用。
未来,安全能力将不再只是外在的治理要求,而可能成为内在的全球竞争力的一部分。无法被度量的安全,最终也难以被治理。