事情源于Anthropic与第三方评估机构Irregular合作开展夺旗测试,提示词明确告知Claude“没有互联网接入”,但由于评估环境配置错误,实际容器仍可访问真实网络
模型将开放互联网上的真实系统误认为是演习的一部分,随即展开攻击。
三起误伤过程如下:
Claude Opus 4.7在找不到模拟目标后,转向一家真实公司的系统执行漏洞测试,最终获取应用凭证和数据库访问权限,接触到数百行生产数据;Claude Mythos 5为完成“供应链攻击”任务,在真实PyPI仓库上传同名恶意包,该代码随后被15台真实系统下载执行,其中一家安全公司的相关凭证受到影响;内部测试模型则扫描了约9000个互联网目标,在进入真实应用后发现目标并非测试环境,最终停止行动。
7月23日发现记录当天,Anthropic暂停了所有网络相关评估,并于7月27日通知Irregular及三家受影响组织。
Anthropic表示,未来将扩大测试记录监控、改进异常行为检测、加强第三方合作伙伴审查,并邀请独立机构对事件进行复核。
这起事件暴露了AI Agent时代的新风险:当AI拥有联网、调用工具和执行代码的能力后,如何确保它清楚自己处于什么环境,将成为AI安全的重要问题。

