TrustScale 发布 Argus 平台:以实证校验对抗 AI 幻觉,护航企业级 AI 安全落地
TrustScale 于 2026 年 8 月 5 日宣布推出 Argus——一个专利待批的 AI 保障平台,旨在检测并纠正 AI 幻觉。Argus 采用经验证据与确定性验证,而非“以 AI 检查 AI”的方式,可标记无依据声明并提供基于证据的修改建议。据称,该平台能将 AI 声明验证速度提升至人工研究的 135 倍,并将 AI 输出准确率提升至 98.5%。

美国加州洛斯阿尔托斯(LOS ALTOS, Calif.)——随着生成式 AI 的规模化应用,研究证实大型语言模型(LLM)仍会出现幻觉、编造来源并自信地犯错。这为企业在智能体自动化、研究、内容创作和决策制定中部署 AI 带来了前所未有的风险。
Argus:以实证校验取代“AI 检查 AI”
为解决上述问题,TrustScale 今日宣布推出 Argus——一个专利待批的 AI 保障平台。与“AI 检查 AI”的方法不同,Argus 利用经验证据和确定性验证来审查 AI 生成的内容,标记无依据的声明,并在 AI 错误被发布、分享或依赖之前,提供基于证据的修正建议。
研究表明,AI 幻觉率因任务不同而差异显著,并随任务复杂度增加而上升。即使是前沿模型对简单查询的响应,平均幻觉率也可高达 20%;而针对特定行业的 AI 查询响应,幻觉率甚至可达 88%(数据来源:斯坦福大学 RegLab)。幻觉问题每年给企业造成近 700 亿美元的损失。Argus 使用户验证 AI 生成声明的速度比人工研究快 135 倍,可将幻觉率降低,并将 AI 输出准确率提升至 98.5%。
“AI 行业花了数年时间让 AI 变得更聪明,但可信赖的 AI 才是当下更需解决的大问题。”TrustScale 首席执行官 Lawrence Snapp 表示,“AI 本质上是概率性的,但企业需为 AI 错误带来的成本和风险负责。Argus 通过在用户依据生成式 AI 输出采取行动前提供独立证据,来缓解这一问题。”
高风险行业中的“无声失败”风险
医疗保健、法律和学术界是高风险的行业示例,在这些领域中,AI 用户正不知不觉地暴露于 AI 幻觉风险之下。更严峻的是,Anthropic 的研究显示,91.3% 的 AI 用户不会核查事实与声明,这为“无声失败”创造了环境,可能导致直接的人身伤害。Argus 能够实时检测幻觉,叠加颜色编码的 TrustScore 高亮,并提供确定性证据以支持或反驳 AI 声明,从而防止意外后果。随后,它通过内联建议,让用户一键修正 AI 错误。
基于 20 余年 AI 数据经验构建
Argus 基于 TrustScale Engine 构建,这是一个专有平台,可创建持续的信任控制平面,用于 AI 保障,帮助用户在不妨碍工作流程的情况下做出明智决策。该引擎源自 TrustScale 超过 20 年的 AI 数据经验。
“AI 制造商声称自己更安全、自我治理或追求真理。但在涉及 AI 时,相互矛盾的证据、不同的视角、微妙的语言和独立的保障至关重要。”全球数据创新公司(Global Data Innovation)首席执行官 Dominique Shelton Leipzig 表示,“TrustScale 的 Argus 是首个实时、持续的保障平台,它以证据赋能人类,并实现可信赖的 AI。AI 的风险太高,不能让少数几个大模型来定义你的真相。”
产品可用性与部署方式
TrustScale 的 Argus 今日起以 12 种语言面向企业提供,同时面向个人开放研究预览版,可通过 TrustArgus.ai 访问,或通过 Chrome 扩展在任意位置使用。企业版解决方案可部署在私有和公共数据环境中,并可与任何 AI 模型(包括 ChatGPT、Claude、Gemini、Copilot 和 Grok)配合使用。如需演示,可访问 www.TrustScale.ai 申请。
关于 TrustScale
TrustScale 是一家 AI 训练、评估和保障公司,帮助组织以更高的信心和控制力创建、塑造和使用人工智能。TrustScale 基于在 200 多种语言的 AI 数据领域超过 20 年的经验,开发独立的确定性技术,用于检测 AI 错误、根据经验证据评估声明,并让人类始终处于关键决策的中心。其 Argus 平台提供实时幻觉检测、TrustScore 评级和基于证据的修正建议,适用于公共和私有数据环境。了解更多信息,请访问 TrustScale.ai。
