铭鸿体育资讯网

离谱!Claude测试翻车,误伤3家公司

几个小时前,Anthropic近日披露一起AI安全事件:在一次网络安全评估中,Claude模型意外突破测试环境限制,进入真实互联网,并未经授权访问了3家组织的真实系统。

事情源于Anthropic与第三方评估机构Irregular合作开展夺旗测试,提示词明确告知Claude“没有互联网接入”,但由于评估环境配置错误,实际容器仍可访问真实网络

模型将开放互联网上的真实系统误认为是演习的一部分,随即展开攻击。

三起误伤过程如下:

Claude Opus 4.7在找不到模拟目标后,转向一家真实公司的系统执行漏洞测试,最终获取应用凭证和数据库访问权限,接触到数百行生产数据;Claude Mythos 5为完成“供应链攻击”任务,在真实PyPI仓库上传同名恶意包,该代码随后被15台真实系统下载执行,其中一家安全公司的相关凭证受到影响;内部测试模型则扫描了约9000个互联网目标,在进入真实应用后发现目标并非测试环境,最终停止行动。

7月23日发现记录当天,Anthropic暂停了所有网络相关评估,并于7月27日通知Irregular及三家受影响组织。

Anthropic表示,未来将扩大测试记录监控、改进异常行为检测、加强第三方合作伙伴审查,并邀请独立机构对事件进行复核。

这起事件暴露了AI Agent时代的新风险:当AI拥有联网、调用工具和执行代码的能力后,如何确保它清楚自己处于什么环境,将成为AI安全的重要问题。