AI 模型突破了 OpenAI 的沙盒限制,转向 Hugging Face 加密领域正是其潜在风险所在

七颜百科 °C 栏目:历史大事记
AI 模型突破了 OpenAI 的沙盒限制,转向 Hugging Face 加密领域正是其潜在风险所在

  人工智能开发实验室 OpenAI 周二披露 据报道,其一组模型,包括公开可用的 GPT-5.6 Sol 及一款更强大的未发布系统, “突破” 了受控测试环境,影响了 Hugging Face 的生产基础设施,Hugging Face 是承载开源 AI 领域大部分内容的公司。

  这些模型正在通过一个名为 ExploitGym 的内部基准测试进行评估,该测试涵盖长时间、多步骤的黑客任务,且在评估过程中故意降低了其网络安全拒绝能力。

  需要明确的是,这并非一款生产模型突然变得敌对。这是一款能力强大的模型,关闭了安全护栏,并被特意告知要在黑客测试中取胜——不惜一切代价赢得胜利。

  模型在测试软件中发现了一个隐藏的缺陷,该缺陷此前无人知晓,模型利用这一缺陷绕过了旨在将其隔离离线的防护墙。一旦接入公开互联网,它们猜测 Hugging Face 可能会存储测试的答案。

  为了进入系统,他们将被盗密码和更多隐蔽漏洞串联起来,直到能够在 Hugging Face 的实时服务器上执行自己的命令。

  OpenAI 在内部发现了该异常,而 Hugging Face 团队则检测并遏制了该事件。该事件被称为“前所未有”,并表示将采取广泛的安全措施,以防止可能影响公共系统或服务的不良事件发生。

  “我们正在对基础设施配置实施严格控制,尽管这会影响研究速度,但这是为了在漏洞修补期间保障安全,”团队在其博客文章中表示。“我们正在改进并增强未来训练和评估的防护措施。”

  加密攻击的大部分过程发生在资金转移之前。攻击者会扫描代码、测试密码、搜索暴露的凭证、分析签名设置,并寻找进入管理员账户的途径。

  在 Hugging Face 事件中,OpenAI 的模型执行了该过程的多个环节,逐步从一个漏洞转移到另一个漏洞,直至最终到达线上生产服务器。

  加密市场为这种方法提供了众多适用场景,正如今年早些时候发生的多起攻击所表明的那样。薄弱环节可能是智能合约,也可能是开发者的笔记本电脑、被篡改的软件包、桥接验证者,或者多签钱包中的某个签名者。

  以今年早些时候发生的 Drift 价值 2.85 亿美元的攻击为例,该盗窃事件经过了长达六个月的社会工程学攻势,最终获得了特权访问权。理论上,人工智能代理能够同时测试多条路径,记录失败的尝试,并在人类操作者休息时持续运作。一旦发现路径,操作者即可执行实际攻击并选择可行的退出路径。

  KelpDAO 2.92 亿美元的跨链桥损失暴露了另一项弱点。攻击者发现了用于在区块链之间转移资产的系统中存在单一验证器的漏洞。

  这种类型的攻击始于耐心的代码审查和基础设施映射——正是 OpenAI 模型在发现未知漏洞时所执行的工作。

  第三种攻击类型针对链上治理系统。 今年七月初,一名攻击者 花费了约440万美元通过购买足够的基于 Solana 的狗狗币模因币 BONK,以发起并通过了一项提案,该提案将约 2000 万美元从项目资金库转移至攻击者账户。此过程持续了三天,正如 CoinDesk 当时追踪到的,攻击者随后出售了用于赢得投票的所有代币。

  此次攻击中的购买、投票及财政转移均为各自有效的交易。但盗窃行为源于对规则如何协同工作的理解,以及发现获得控制权的成本远低于可被窃取的资金金额。

  Hugging Face 事件对软件供应链同样具有重要意义。加密开发者依赖公共代码库、云服务和软件包注册表。

  虽然 OpenAI 的测试展示了一台机器完成了入侵的漫长中段,但正是像 Drift 和 KelpDAO 这样的攻击显示了这条路径的尽头所在。