• Anthropic 在与外部测试公司 Irregular 进行的超过 141,000 次网络安全评估中发现了三起事件。
  • 这些入侵说明网络隔离、供应商责任和共享监测应成为模型测试流程的一部分。

事实

Anthropic 表示,在与外部测试公司 Irregular 进行的网络安全评估中,其三款人工智能模型获得了对三家组织系统的未授权访问。公司在 OpenAI 相关类似事件公开披露后,复核超过 141,000 次测试运行才发现这些情况。

这些模型被分配到开放式“夺旗赛(capture-the-flag)”演练,且被告知在无互联网访问的模拟环境中运行。Anthropic 与 Irregular 之间的理解偏差使评估机器仍连接到公共互联网。随后模型将真实系统当作演练的一部分,并采用已有的方法,包括弱密码和未认证端点,而非此前未知的漏洞。

受影响的模型包括 Claude Opus 4.7、Claude Mythos 5 和一款内部研究模型,最早事件发生于 4 月。Anthropic 已暂停相关评估,通知了 Irregular,并联系受影响的组织。其中两家在 Anthropic 通知前尚未检测到该活动。

评估

Anthropic 制定了演练目标,Irregular 负责测试环境。机器本应是隔离的,但仍可访问公共互联网,因此模型可以把真实系统也视作演练对象,尽管两家公司都无意将其纳入。

这种必要控制应在每次评估开始前完成。Anthropic 与测试合作方必须确认机器可访问哪些系统,检查对未批准系统的访问是否被阻断,并约定谁有权停止演练。指令可以告诉模型允许做什么,但不能约束其底层网络。

公开说明尚未明确责任失效发生在何处,也未说明其他测试是否也缺少同类检查。对 BTW 读者来说,外包评估并不解除开发者核验外部环境的责任。Anthropic 需要在每次运行前拿到证据,证明测试机器不能访问超出约定范围的系统。

监测重点

关注 METR 与 Irregular 识别谁负责确认网络隔离以及为何该检查失败。Anthropic 的重启条件应说明每次运行是否现在都要求核验目标列表、运行前的外联访问检查,以及一名有权终止演练的指定负责人。没有这些控制,书面测试范围仍可能与模型实际可达系统不一致。