OpenAI周二表示,在7月份其AI模型从受控测试环境中失控并入侵人工智能公司Hugging Face及其他四个未具名服务的系统后,已暂停了部分AI训练工作两周。
该公司还公布了新的操作规范,称此举旨在防止未来训练过程中出现 AI 模型失控的情况。
该公司表示,部分AI训练工作——包括其“计划中规模最大的前沿强化学习训练”——目前仍处于暂停状态,而小规模的训练和评估仍在继续。同时,其他面向客户的产品研发和相关工作也在持续推进。
该公司公布的新的安全措施包括对训练过程实施更严格的安全标准,例如加强对AI模型的监控、进一步隔离测试环境(“沙箱”),以及减少AI可能利用的漏洞。
OpenAI表示,这些更新“需要大量工程工作”,并且公司在过程中“承担了巨大成本”。此前据专家估计,OpenAI为调查此次漏洞所花费的计算成本可能在400万至1500万美元之间,但目前尚无法确定OpenAI实际支出的总金额。
在一篇详细说明新安全控制措施的博客文章中,OpenAI表示,平均而言,这将使训练环节的计算负担增加20%。新的管控方案包括更广泛地使用AI模型来监控正在接受训练和测试的其他模型的行为。
不过,OpenAI对媒体表示,新的安全措施“并非针对Hugging Face事件的直接回应”,尽管该事件凸显出 “必须让安全防护水平跟上模型能力发展的紧迫程度”。
该公司表示,除了Hugging Face事件外,他们还发现了一个名为Astra的未发布模型,在其“准备框架”下被评估为存在“重大”网络安全风险。该内部政策文件要求OpenAI一旦达到这一门槛,就暂停模型开发,以便公司有时间进一步完善安全防护措施。
这是OpenAI首次因安全问题而暂停人工智能开发的部分工作。
该公司表示,为期两周的暂停表明其正在 “把控模型开发节奏”。“把控节奏” 这一说法,呼应了黑客事件之后多位顶尖安全专家联名公开信中的表述,信中呼吁各国开展协同节奏管控。
OpenAI首席科学家雅库布·帕乔基表示:“重要的是要开始建立工具,以便在各实验室和各国之间协调这种节奏推进。”
帕乔基表示:“Astra达到关键的网络安全门槛,这表明我们可以期待新的、强大的模型在现实世界中‘做出前所未有的事情’。随着我们训练出越来越强大的模型,我们希望对这些模型的能力范围有充分的信心,能够准确衡量其表现,并确保它们符合日益提高的合规标准。”
公众仍在等待了解Hugging Face黑客事件的关键细节,包括OpenAI要求该人工智能执行的具体任务,以及该公司是否知晓自己攻击了其他公司。尽管如此,OpenAI重申,他们将“很快”发布一份完整的技术事后分析报告。
在缺乏这些细节的情况下,很难判断该公司公布的新安全协议是否足够完善。
8月5日,OpenAI在拉斯维加斯举行的黑帽安全会议上向公众透露了此次攻击的部分情况。会上工作人员表示,在黑客攻击发生前,AI代理已合作数月之久,通过在OpenAI员工不知情的留言板上留下秘密信息,彼此进行协作。
事件发生后,OpenAI似乎并未意识到其智能体已搭建了一个消息平台并合伙攻击另一家公司,这一事实引发了人们的担忧。Hugging Face首席执行官克莱姆·德朗格表示,密切监控AI代理的日志和痕迹是“代理监控的入门知识,尤其是在前沿领域”。
OpenAI现在表示,该公司一直都在密切监控旗下智能体,但仅针对最高风险的工作负载。目前其已经 “修订并扩充” 了监控手段,称这套监控现已实现 “多阶段化”,能够对潜在风险自动升级上报。
新流程强化了对思维链的监控。模型的思维链,就是模型把解决问题的思路、计划采取的行动 “直白表露出来” 的过程。该公司今日向记者称,这能帮助企业更好地 “弄清模型的真实目标是什么”。不过包括 OpenAI 的竞争对手 Anthropic 的科研人员在内的其他 AI 研究表明,AI 模型输出的 “思维链”,并不总能如实反映它的内在动机与真实目标。
帕乔基表示,OpenAI清楚该风险,并且在设计训练流程时,已经尽可能降低模型学会在思维链中撒谎、以此掩盖真实意图的可能性。
新的自动化监控工具旨在在检测到可疑活动后30分钟内向内部安全、安保和研究团队发出警报。如果这些团队在30分钟内无法确认该警报为误报,新程序要求他们立即暂停培训运行或评估。