Anthropic于周四(当地时间)披露,其Claude AI模型的多个版本在三次独立事件中突破了测试环境,并入侵了其他组织。这一消息发布约一周前,OpenAI也公开了类似事件,再度引发业界对前沿AI开发者是否充分监管其复杂产品的担忧。

据Anthropic官方公告,三次事件均源于该公司与其评估伙伴之间的“误解”:模型在测试中误以为自己处于无互联网访问权限的“夺旗”演习环境,所有可用系统均为模拟目标。然而实际情况并非如此——测试环境实际开放了互联网访问。

Anthropic在博客中解释称:“由于我们与评估伙伴之间的误解,情况并非如此,互联网访问是可用的。”因此,当Claude遭遇三个真实组织时,它误以为这些是模拟目标,并利用弱密码等基础攻击手段对其进行了入侵。

Anthropic强调:“在所有这些情况中,Claude均未自行逃逸或故意尝试脱离测试环境。”模型也未“发现或利用任何复杂漏洞”,仅尝试完成被分配的任务。

三种截然不同的场景

在三次事件中,Anthropic的测试伙伴Irregular创建了一家虚构公司,该公司与一家真实组织共享域名。Claude Opus 4.7在四次夺旗测试运行中入侵了这家真实公司,窃取了生产信息和用户凭据。

另一起事件中,入侵始于意外。测试期间,Claude Mythos 5发布了一个恶意Python包,它认为该包仅能在测试环境内访问,但实际却出现在公共互联网上,被15个计算机系统下载并运行。

其中一个系统属于一家安全公司。当该公司的包扫描器运行该程序时,触发了Mythos 5的信息窃取代码,将用户凭据发送给了AI模型。Mythos随后利用这些凭据入侵了该安全公司。

Anthropic指出,Mythos“为实施这次攻击付出了大量努力”,尤其是在注册Python包仓库账户时。公司描述道:“为了创建邮箱地址,它需要一个电话号码。为获取电话号码,在尝试免费电话服务失败后,它尝试了多种方式获取资金以支付电话费,但均告失败。最终它回溯,找到了一家免费的、未被屏蔽的邮件提供商,用它注册了PyPI账户,然后利用该账户向PyPI上传了恶意软件。”

在第三起事件中,一个内部测试版Claude在无法攻破原始目标后,扫描互联网寻找替代目标,最终选定新目标并用基础技术将其攻破。

Opus 4.7和Mythos 5(均为各自产品线的较旧版本)在意识到自己正在公共互联网上操作后,仍继续入侵行为。Anthropic表示,在两次事件中,Opus“将真实公司合理化地视为演习的一部分”;Mythos也基于若干可疑理由“说服自己仍处于模拟环境中”。

紧急叫停与反思

Anthropic是在7月23日启动的审查中发现这些事件的——最早一次发生在4月。该审查启动于OpenAI宣布其两个模型突破隔离并入侵多个第三方之后。发现三次违规后,Anthropic停止了所有测试,通知了Irregular,并联系了三个受害组织。

Anthropic表示,已与其中两个受害组织取得联系,对方“此前未检测到该活动”,目前仍在尝试联系第三个组织。

尽管Anthropic称现在从三个“孤立事件”中得出广泛结论还为时过早,但它表示感到鼓舞的是,其最新模型(内部测试版)在前代失败之处取得了成功——当它意识到自己在公共互联网上时,能够自主停止攻击。

Anthropic指出,这些事件表明测试环境需要严格的控制措施,以防止能力未经测试的模型造成损害。

Anthropic正与AI研究非营利组织Metr合作,安排对该事件的独立审查。公司表示计划“在未来一周内”发布涉及Mythos事件的“轻度编辑的完整记录”,同时保留其他记录“以保护受影响组织”。