Anthropic于周三解冻其先进AI模型Fable和Mythos的访问权限,此前特朗普政府已解除相关出口管制禁令。

两款模型的回归——其中Fable 5面向一般用户开放,而功能更强大的Mythos 5仍如禁令前一样,仅限于受信任的合作伙伴联盟使用——标志着特朗普政府与AI企业之间关于前沿模型负责任部署的持续谈判取得重要进展。过去数月,美国政府与科技行业在这一问题上一直存在分歧。

在周二宣布解决这一AI领域最激烈冲突之一的声明中,Anthropic坚称其模型始终是安全的,并认为政府夸大了事态的严重性——这暗示未来围绕如何在向防御方提供先进能力与防止美国对手获取这些能力之间取得平衡,仍将存在紧张的对话。

美国商务部是在亚马逊向政府发出警告后发布出口管制禁令的,该警告称Fable的安全防护措施存在被绕过的可能。周二,Anthropic重申了其论点——一个领先的网络安全专家联盟也提出了相同观点——即功能较弱的AI模型也存在同样的问题,但该公司同时表示已“迅速采取行动解决所报告的绕过问题”。

Anthropic表示,在过去两周与“政府及其他合作伙伴(包括亚马逊)”密切合作后,该公司“训练了一个改进的安全分类器,用于定位并阻止报告中描述的行为”。

Anthropic补充道,美国国家标准与技术研究院AI标准与创新中心的研究人员“已对我们之前及新的安全防护措施进行了测试,并一致认为它们非常强大”。

与此同时,该公司警告称,这些变化可能会对寻求防御性工作协助的网络安全研究人员产生一些负面影响。

“新的分类器……在常规编码和调试任务中,会以更频繁地标记良性请求为代价,”Anthropic表示。“与我们的所有安全防护措施一样,我们将继续对其进行优化,以更好地区分真正的滥用与合法请求,并减少误报。”

呼吁建立更正式的审查流程

尽管围绕Fable和Mythos的争议可能已经结束,但AI行业仍对特朗普政府审查前沿模型可用性的随意方式感到担忧

特朗普最近发布了一项行政命令,为前沿AI公司向政府提供某些特别强大模型的早期访问权建立了流程。周三,Anthropic表示将为“在国家安全相关领域实质性推进能力前沿的模型”提供这种早期访问。该公司还表示,将分享有关黑客如何滥用其工具的情报,并参与特朗普指令中建立的漏洞信息共享中心。

Anthropic强调了与政府密切合作以应对潜在AI安全风险的承诺。该公司表示,正在“大幅扩大”与联邦机构的合作,包括投入专门人员和计算资源。它还承诺“与政府及行业同行合作,共同制定一项自愿性的前沿模型提供商安全与评估标准”。

Anthropic还指出,目前“缺乏公认的标准”来对越狱行为的严重性进行分类——这是任何正式模型审查流程的重要先决条件。

“一个评估AI越狱的通用标准将帮助我们及其他公司安全地发布新模型,同时也能让用户充分利用其先进功能,”Anthropic表示。

为此,该公司宣布,正在与亚马逊、谷歌、微软及Project Glasswing的其他成员(Anthropic通过该项目向经过审查的组织授予Mythos访问权限)合作,制定一个关于越狱分类与响应的“共识框架”。该公司表示,该框架设想从四个标准对每个潜在越狱进行评级,包括发现该绕过方法的难易程度,以及该绕过方法所额外释放的模型能力大小。