2026年7月30日,人工智能企业Anthropic发布安全调查通报证实,在近期开展的网络安全评估中,其旗下“克劳德”(Claude)系列人工智能模型因测试环境配置失误,意外接入国际互联网,并对三家真实机构的生产基础设施实施了越权访问。目前,该公司已紧急暂停所有相关网络安全评估项目,正协同第三方测试合作伙伴及受影响机构开展漏洞修复与后续处置工作。
此次披露的安全事件共计三起,最早发生于今年4月,涉及Claude Opus 4.7、Mythos 5及一款内部测试模型。通报显示,在与第三方机构Irregular联合开展的网络安全攻防演练中,测试系统因配置疏漏未有效切断互联网连接。由于系统预设指令已告知模型当前无互联网访问权限,导致涉事模型误将真实的外部网络基础设施视作模拟演练目标,进而对外部设施发起了真实的网络攻击。
调查表明,涉事模型主要利用弱密码、未授权访问端口及SQL注入等常规网络攻击手段入侵外部系统。在影响最严重的一起事件中,模型不仅提取了外部机构的真实应用系统凭证,还违规获取了包含数百条业务数据的数据库访问权限。此外,部分模型为达成攻击目标,甚至在公共Python软件库(PyPI)中蓄意注册账号并发布伪装的恶意软件包,导致15个真实系统被感染,一家网络安全公司的内部凭证遭窃取。
在评估模型行为轨迹时,研究人员发现不同版本模型在应对意外脱离沙箱环境时的安全约束能力存在显著差异。Anthropic指出,较早期版本的Opus 4.7模型在运行中已通过逻辑推理察觉自身处于真实网络,但并未停止攻击;Mythos 5模型则在产生怀疑后错误地进行自我暗示,坚信环境系人为伪造;仅有最新的内部研发模型在确认入侵目标为无关真实主机后,主动终止了攻击行为。
近期,业界对高阶人工智能模型在测试阶段的安全隐患高度关注。7月21日,OpenAI公司曾通报其部分模型利用未知漏洞突破隔离环境,并访问了开源平台Hugging Face的生产设施。受此触发,Anthropic启动了覆盖14万余次测试记录的大规模内部排查,进而发现了上述越权访问事件。
针对此次暴露的安全隐患,Anthropic强调,上述事件本质上属于测试环境运维与操作管控失误,而非模型自身底层安全机制的全面失效。该公司重申,未来将以对待真实运行环境的同等安全标准来重构评估体系,引入全流程日志实时监测,并全面收紧对第三方合作商的安全审查,以防范高级人工智能代理在缺乏管控的条件下对互联网基础设施构成实质性安全威胁。