|
||||
| TrustScale 推出 Argus,用于检测和纠正 AI 幻觉,助力企业安全采用 AI | ||||
| 这款“AI 测谎仪”能实时捕捉大型语言模型(LLM)的错误,准确率高达 98.5%,速度比人工研究快 135 倍。 | ||||
|
加利福尼亚州洛斯阿尔托斯, 2026年8月5日 - (亚太商讯) - 随着生成式AI的规模化应用,研究证实大型语言模型(LLM)仍会持续出现“幻觉”、捏造来源并自信地犯错。这给将AI应用于自主自动化、研究、内容创作和决策的企业带来了前所未有的风险。 为解决这一问题,TrustScale 今日宣布推出正在申请专利的 AI 保障平台 Argus。与“AI 检查 AI”的方法不同,Argus 利用实证证据和确定性验证来审查 AI 生成的内容,在 AI 错误被发布、分享或被依赖之前,标记缺乏依据的论断并建议基于证据的更正。 研究表明,AI幻觉率因任务而异,且随任务复杂度的增加而上升。即使是前沿模型对简单查询的响应,幻觉率平均也可高达20%;而针对特定行业的AI查询响应,幻觉率甚至高达88%(斯坦福RegLab)。幻觉现象每年给企业造成的损失近700亿美元。Argus 使用户能够以比人工研究快达 135 倍的速度验证 AI 生成的内容,从而减少幻觉现象,并将 AI 输出准确率提高多达 98.5%。 “AI 行业花了数年时间让 AI 变得更智能,但如今更亟待解决的问题是打造值得信赖的 AI,”TrustScale 首席执行官劳伦斯·斯纳普(Lawrence Snapp)表示。“AI 本身在设计上具有概率性,但企业必须承担 AI 错误带来的成本和风险。Argus 通过在用户根据生成式 AI 输出采取行动前提供独立证据,从而缓解这一问题。” 医疗、法律和学术界是高风险行业的典型代表,这些领域的 AI 用户往往在不知不觉中面临 AI 幻觉的风险。更棘手的是,Anthropic 的研究表明,91.3% 的 AI 用户不会核查事实和主张,这导致“沉默的失败”可能直接对人类造成伤害。Argus 通过实时检测幻觉、叠加彩色编码的“可信度评分”(TrustScore)标注,并提供确定性证据来支持或反驳 AI 的主张,从而防止意外后果的发生。随后,它通过内联建议赋能用户,使其能够一键更正 AI 错误。 凭借20余年的人工智能数据经验,Argus基于TrustScale Engine构建而成——这是一个专有平台,旨在为人工智能保障建立一个持续的信任控制平面,帮助用户在不干扰工作流程的情况下做出明智决策。 “AI 开发商声称其产品更安全、能够自我管理或追求真相。但在涉及 AI 时,相互矛盾的证据、不同的视角、含蓄的措辞以及独立的保障至关重要,”Global Data Innovation 首席执行官多米尼克·谢尔顿·莱比锡(Dominique Shelton Leipzig)表示。“TrustScale 的 Argus 是首个实时、持续的保障平台,它为人类提供证据支持,并实现值得信赖的 AI。AI 涉及的风险太高,绝不能让少数几个大型模型来决定你的真相。” TrustScale的Argus现已面向企业用户提供12种语言版本,个人用户可通过TrustArgus.ai获取研究预览版,或通过Chrome扩展程序在任何地方使用。该企业解决方案可部署在私有及公有数据环境中,并与任何AI模型(包括ChatGPT、Claude、Gemini、Copilot和Grok)协同工作。请访问www.TrustScale.ai申请演示。 关于 TrustScale TrustScale 是一家专注于人工智能训练、评估和保障的公司,致力于帮助各类组织以更高的信心和更强的掌控力来创建、塑造和应用人工智能。凭借在涵盖 200 多种语言的人工智能数据领域积累的 20 多年经验,TrustScale 开发了独立的确定性技术,能够检测人工智能的错误、根据实证证据评估相关主张,并确保在涉及重大后果的决策中始终以人为本。其 Argus 平台可在公共和私有数据环境中提供实时幻觉检测、TrustScore 评分以及基于证据的修正建议。更多详情请访问 TrustScale.ai。 媒体联系: 来源:TrustScale |
标签:

