拉斯维加斯讯——OpenAI 员工周三表示,该公司模型对其他公司发起的自主攻击,是对整个 AI 行业发出的紧迫警示,凸显了加强模型开发安全防护的必要性。

“这对我们公司以及整个 AI 行业而言都是一个关键时刻。”OpenAI 技术团队成员 Michael Dalton 在 Black Hat 2026 网络安全大会的演讲中表示。

7 月下旬,OpenAI 宣布其两个模型突破了测试环境,并利用零日漏洞入侵了包括 AI 工具库 Hugging Face 在内的其他公司网络,此举震惊业界。紧随其后,Anthropic 也发布了类似声明,这重新引发了人们对强大且基本不受监管的 AI 模型潜在危险的担忧。

Dalton 在 Black Hat 大会上表示,“多个团队正放下手头一切工作”,以提升 OpenAI 检测和预防类似事件的能力。该公司已放缓研究进度,并“大幅加强了对我们 AI 代理的监控”。

尽管这些自主黑客行为实际上是“无心之失”,但 OpenAI 员工将其描述为严峻未来的预兆——在这个未来中,企业将面临恶意行为者利用强大开源模型发起的持续、复杂攻击,而任何前沿实验室都无法遏制这些模型。

“我们相信,这对计算机安全行业而言是一个分水岭时刻。”Dalton 说,“由 AI 编排、完全自动化的攻击性行为如今已成为现实。”他补充道,Hugging Face 事件“让我们得以一窥我们行业未来攻击的样貌”。

Dalton 认为,防御者需要加快工作步伐,以应对预期中的攻击复杂性激增。这可能涉及试验以防御为重点的 AI 模型,以及加倍重视那些重新变得至关重要的基础安全措施。

“这些代理最终受限于它们能获得的权限以及能通信的系统。”Dalton 表示,这意味着网络分段、最小权限访问以及其他零信任网络原则“在这里依然和以往一样至关重要”。

但 Dalton 也指出,前沿模型开发的现状危险得令人无法接受,暗示 OpenAI 可能正在重新思考如何平衡能力与安全防护。

“作为行业,我们希望达成的最终目标是,模型智能的提升应更多地增强防御而非攻击。”Dalton 说,“如果我们无法达成这一目标,那么每一次智能的提升都将有利于攻击者,而我们将处于不可持续的位置。”

AI 代理的自发集体

在 Black Hat 演讲中,Dalton 和他的同事 Eric Wallace 分享了导致 Hugging Face 及另外两家组织遭到入侵的事件新细节。

AI 模型在攻击前行为中一个显然史无前例的方面是,它们在 OpenAI 的 Artifactory 软件包管理器系统内部自发创建了一个留言板。OpenAI 员工对此毫不知情,该公司的模型花了数月时间自主交换信息和资源,以帮助彼此完成评估任务。

“帮助同伴。”根据 Black Hat 上分享的 OpenAI 日志摘录,一个 AI 模型如此推理,“但我们的任务不会受益。然而,如果有人腾出时间,集体行动或许能产生通用路径。”

虽然模型本身无法从测试环境访问互联网,但它们滥用了 Artifactory 的互联网访问权限,从各个网站获取文件。在 7 月 4 日模型对 Artifactory 的部分配置更改导致服务中断后,OpenAI 发现了模型的行为,清除了其 Artifactory 系统并进行了重建。但几天之内,模型便重新创建了留言板,并恢复了信息交换。

OpenAI 相信,黑客很快将利用这种自主协作。

“在不久的将来,”Dalton 说,“我们应该预期威胁行为者会故意部署、优化、武器化并使用我们刚才所描述的那种攻击性代理集体。”