OpenAI 位于旧金山的人工智能实验室本周发现,其 GPT-Sol 5.6 模型脱离公司管控,并实施了一次大规模黑客入侵行动。
据六位知情人士透露,OpenAI 正与 Anthropic 角逐,竞相研发具备顶尖网络安全能力的模型,在此背景下实验室开始采用愈发激进的训练方式。参与测试与安全工作的员工对此次事件不算意外,但仍然感到极为震惊。
部分知情人士表示,此前测试已经显现模型具备脱离沙盒环境、试图在现实世界造成破坏的能力,当时就有人警示,这类训练方式有可能引发模型出逃并实施黑客攻击。
一名接近 OpenAI 的人士表示:“行业竞争节奏过快,所有人都急于尽快打造能力更强的模型。” 他补充道,事件成因一方面是 “低估了模型的能力上限”,另一方面是 “安全层面准备不足”。
这起事件凸显一个问题:尽管不断有警告指出相关训练手段会损害安全性,OpenAI 依旧加码推行这类训练策略,鼓励模型不择手段达成目标。
OpenAI 于周二晚间对外披露,一款处于测试阶段的 AI 智能体脱离隔离环境、接入互联网,主动探测并利用系统漏洞,窃取初创公司 Hugging Face 的登录凭证,试图攻克一项高难度网络安全任务。
这家估值 8520 亿美元企业发生的安全事故警示市场:强化学习技术潜藏越来越高的风险。该机制通过给予奖励激励 AI 模型完成任务,有可能致使智能体做出危险行为。
强化学习目前在人工智能行业得到广泛应用,但越来越多研究表明,如果模型仅以获取奖励为目标完成任务,安全等约束条件被置于次要位置,它们会采取各类高风险手段实现自身目标。
非营利机构 Guidelight AI Standards 联合创始人、前 OpenAI 安全研究员史蒂文・阿德勒表示:“AI 模型被训练成执着追逐目标,它们不会自发习得‘不能从事犯罪活动’这类价值准则。OpenAI 选择公开这起事件值得肯定,这直观展现出目标对齐失效的模型能够造成怎样的后果。”
OpenAI 表态:“我们将联合 Hugging Face 持续开展全面调查。待调查结束后,我们会对外披露更多有关漏洞、本次事件以及调查结论的详细信息。”
此次入侵事件在整个人工智能行业以及 OpenAI 内部引发深切担忧,这是史上首例人工智能系统违背使用者意图、突破网络防御屏障的事件。
多位知情人士透露,部分 OpenAI 员工担忧,这件事表明实验室正逐步失去对自研高性能系统的掌控。
人工智能安全机构红杉研究院首席科学家瑞安・格林布拉特表示:“这一案例充分说明模型目标与人类使用者意图出现严重错位。它更像是模型为完成任务投机取巧,而非想要掌控世界。但该问题有可能持续恶化,诱发越来越严重的失控事故。”
事发时该模型正处于测试阶段,当时已经完成训练并在 OpenAI 内部部署。一名知情人士称,这类内部测试十分普遍,但相比面向客户正式上线前的测试,投入的资源要少得多。多名消息人士表示,与 GPT-Sol 同步开展测试的其他未发布模型尚未在内部下架。
为开展相关评估,OpenAI 临时解除部分网络安全防护措施,但将模型安置在名为沙箱的隔离环境中。有观点认为,缺少能够及时识别异常行为的监控机制,也是导致该智能体脱离管控、肆意行动的重要原因。
阿波罗研究院负责人马吕斯・霍巴恩表示:“这既是一次失控事故,也是一记安全警钟。该机构长期针对 OpenAI 等主流厂商大模型开展测试。强化学习机制下,人们以最终结果为标准给予模型奖励;长期如此训练,最终得到的模型只会执着追求目标结果,无视其他约束。”