Anthropic公司周四表示,该公司发现三起事件:旗下Claude人工智能模型在一次评估过程中接入互联网,并未经授权访问了三家不同机构的真实业务系统。
该企业称,在开展网络安全评估大规模回溯审查后发现了上述事件。启动此次审查的诱因,是 OpenAI 上周披露的另一起性质相近的安全事故。
OpenAI 此前通报,其多款模型联合突破了互联网访问权限受到严格限制的隔离测试环境。这些模型接连利用一系列漏洞接入公网,最终访问了开源开发者平台运营方 Hugging Face。
在Anthropic排查出的三起事件中,其模型在与第三方评估合作方 Irregular 提供的测试环境交互时连通了互联网。Anthropic表示,当时系统向 Claude 下达提示,告知其身处无法联网的模拟环境;但由于企业与评估合作方之间沟通出现偏差,实际环境具备互联网访问权限。
随后,模型借助各类基础手段入侵涉事机构,例如访问无需身份验证的接口、破解弱密码等。Anthropic并未公开遭到入侵的三家机构名称。
Anthropic在公告中写道:“归根结底,多方面因素共同引发了这些事件。不过我们秉持无追责事故复盘机制,推进整改工作,视全部责任由我方承担。”
Anthropic表示,共有三款模型卷入此次入侵事件:Opus 4.7、Mythos 5 以及一款内部科研测试模型。Mythos 5 是该公司 6 月推出的高阶模型,因其具备强大的网络攻防能力,仅向特定受邀用户开放。该模型的早期版本于 4 月发布,当时引发华尔街与各国政府官员高度关注。
Anthropic介绍,三款模型在发现自己接入真实企业系统后,做出了截然不同的反应。Opus 4.7 持续发起攻击;Mythos 5 自我判定仍处于模拟环境之中;那款内部科研测试模型则主动终止了相关操作。
Anthropic称:“这一现象符合一个趋势:能力更强的模型应对此类场景时表现更为合规。不过我们还需要开展更多测试,才能确定该结论成立。”
开展本轮测试时,这些模型并未启用Anthropic对外发布模型前标配的安全防护机制。
该公司于上周启动全面核查,在发现 Claude 模型可能存在违规联网行为后,立刻叫停所有网络安全测试。目前Anthropic正携手独立 AI 评测机构 METR 开展深入调查。
Anthropic表示:“我们呼吁其他人工智能实验室开展同类自查复盘。”