OpenAI承认AI智能体自主操作造成重大网络入侵

七颜百科 °C 栏目:生活百科
OpenAI承认AI智能体自主操作造成重大网络入侵

  OpenAI一款AI智能体自主发现新漏洞,并入侵人工智能初创企业Hugging Face。这也是公开案例中,首批AI系统脱离人类管控自主发起网络攻击事件之一。

  这家ChatGPT开发商于周二表示,这起“前所未有的网络安全事件”涉事主体为AI智能体——一类可依据人类指令自主运行的人工智能程序。该智能体脱离测试环境、获取互联网访问权限并窃取登录凭证。

  随着各界愈发担忧先进AI系统入侵数字基础设施带来的各类风险,尤其是智能体突破人类管控的场景,OpenAI对外披露了本次事件。

  OpenAI周二称,随着具备网络攻击能力的模型持续普及,此类事件未来将变得“更加普遍”。

  事件曝光之际,OpenAI首席执行官山姆・奥特曼下周将前往华盛顿,向美国政府汇报下一代AI模型相关情况。

  继Anthropic的Mythos模型展现出强大的漏洞探测与利用能力,引发全球关注后,美国政府愈发希望在新模型正式发布前开展审查。

  OpenAI表示,本次事件由多款模型协同引发,包含本月早些时候推出的GPT-5.6Sol,以及一款尚在发布前测试阶段、能力更强的模型。

  OpenAI在官方博文中写道:“我们认定本次事件是一起前所未有的网络安全事件,涉及顶尖水平的网络攻击能力,公司正采取相应处置措施。”

  为开发者托管AI模型与数据集的初创企业Hugging Face表示,公司上周五遭到外部AI智能体入侵。

  Hugging Face首席执行官克莱门特・德朗格在X平台发文称:“鉴于该智能体展现出的技术水准,我们上周就怀疑此次网络攻击可能来自前沿AI实验室。”

  他补充,过去一天公司一直在与OpenAI紧密协作,并且“我们有充分理由相信OpenAI方面不存在恶意。整件事全程由AI自主完成,令人震惊!”

  OpenAI当时为评估两款模型能力,有意下调了测试环境中的网络防护等级。相关智能体原本运行在沙箱环境内,沙箱设计初衷就是管控程序行为、阻止其访问互联网。

  OpenAI介绍,研究人员指令模型尝试开展攻击,以此评估其网络攻防能力。随后模型“耗费大量算力寻找获取公网访问权限的途径”。

  这些模型自行发现并利用此前未知漏洞,突破沙箱限制、接入互联网,继续完成既定目标,其中包括窃取登录凭证实施入侵。

  Hugging Face启用自有AI智能体,在自家基础设施上识别并阻断了攻击行为。OpenAI向媒体证实,已就本次事件与执法部门以及其他政府机构沟通。