EN

前沿AI模型对恶意提示的脆弱性高于厂商宣称水平

思科研究人员于周三发布报告指出,主要AI开发商的安全声明基于对黑客行为的错误假设。对15个前沿模型的测试显示,多轮恶意提示攻击成功率在8%至88%之间,而单轮攻击仅为2%至65%。研究还发现,公开强调模型能力的厂商,其模型在多轮攻击下的脆弱性差距更大。

2026-05-2710阅读
前沿AI模型对恶意提示的脆弱性高于厂商宣称水平

速览要点

  • 思科研究人员在周三发布的报告中指出,主要AI开发商关于模型安全的声明,建立在关于黑客行为方式的错误假设之上。
  • AI厂商假设,只要模型能够抵御单次恶意提示,即可确保不被劫持;但思科表示,黑客正越来越多地使用多阶段提示来绕过模型防御,而大多数模型并未为此类攻击做好准备。
  • 这份新报告揭示了一个在AI模型中大多未被充分认识的危险,它可能使使用这些工具的企业面临广泛的干扰与损害。

深度解析

思科对来自OpenAI、Anthropic、Google、Amazon和xAI的15个领先AI模型进行的评估发现,“单轮攻击成功率(ASR)并不能可靠地反映攻击者能够跨轮次进行自适应调整时的实际情况”,研究人员Nicholas Conley和Amy Chang写道。

他们的测试显示,AI模型对多轮恶意提示的脆弱性显著更高——多轮攻击成功率介于8%至88%之间,而单轮提示的成功率范围仅为2%至65%。

“我们测试的每个模型都表现出不可忽视的多轮ASR,”Conley和Chang写道。

这两位研究人员此前曾合作撰写了一份2025年11月的报告,该报告发现开放权重AI模型对多轮攻击的脆弱性是对单轮攻击的两到十倍。

“我们在开放模型中记录到的模式在封闭模型中也同样存在,”他们在新研究中写道。“在这一队列中,没有任何前沿封闭模型可以被描述为在迭代攻击下是安全的。这是对封闭模型前沿当前状态的论断,而非针对任何单一厂商。”

该研究最重要的发现之一是AI公司的优先级与其模型安全性之间的相关性。Conley和Chang发现,那些公开强调其模型能力不断增强的AI开发商,其模型在单轮攻击与多轮攻击脆弱性之间的差距最大。而那些公开声明强调模型安全的开发商,其差距较小,这表明他们在降低风险方面做出了更为协调一致的努力。

研究人员测试了五种策略:角色扮演、误导模型、信息分解、重构模型拒绝以及渐进式升级。xAI的模型Grok 4.1 Fast Non-Reasoning表现最差,研究人员在多轮攻击中成功率达到88%(针对该模型的单轮攻击成功率为34%)。

表现最好的模型是Amazon的Nova 2 Lite,仅未能抵御8%的多阶段攻击,不过研究人员表示,这一数字“仍然代表着有意义的残余风险”。

Conley和Chang指出,Grok 4.1在启用推理功能后表现显著改善,这表明AI厂商应“记录推理状态等配置决策对安全性的影响”。

OpenAI、Anthropic、Google、Amazon和xAI未立即回应置评请求。

研究人员表示,厂商需要重新思考如何评估AI模型安全性,而企业需要更多关于模型在单轮与多轮攻击韧性之间潜在差距的信息。

“基于已发布的单轮得分做出的商业决策,会带来安全与治理风险,”Conley和Chang写道。“一个单轮ASR为2.74%的模型,与一个多轮ASR保持在24.68%的模型并非同一产品。如果没有配对场景的数据,在大多数公开评估中两者无法区分,最终用户永远看不到这一差距。”