← 返回 2026-09-21 简报

与埃森哲合作开展嵌入式评估

语音播报
摘要
事件:Anthropic与埃森哲合作开展前沿AI独立评估,旨在落实CEO关于将评估者嵌入公司的承诺,共同推进模型安全验证工作。 要点:双方各投入至少十亿美元建设能力;评估者将深入公司内部,拥有类似员工的访问权限以监控训练过程并识别盲点。 影响:此举为行业树立先例,推动建立共享标准的独立评估生态系统,增强公众对AI安全承诺可验证性的信任。

我们正与埃森哲合作,对前沿人工智能进行独立评估。这是迈向我们在首席执行官文章《我们必须为前沿技术设定节奏》中所承诺的重要一步,即在人形智能公司Anthropic内部嵌入评估机制。

该合作将由埃森哲旗下专注于人工智能的专业业务部门Faculty主导,包括对模型进行评估和红队测试、开展对齐性评估以及测试模型的安全保障措施。埃森哲协助企业和政府在许多行业中部署人工智能。他们对企业如何在实践中使用人工智能的理解,为其安全方法提供了依据,并将把这一视角带入对我们模型的评估中。

Anthropic和埃森哲预计在未来五年内,各自将在该领域的能力建设上投入至少10亿美元。

嵌入式评估是一项新举措,关于其运作方式的一些细节仍在制定中。与当前的外部评估者不同,嵌入式评估者将在人工智能公司内部工作,拥有与员工相当的访问权限。这种访问权限使他们能够观察模型在训练过程中的形成,追踪决定模型构建和部署的决策,并直接与员工沟通。从这一视角出发,嵌入式评估者可以评估公司的运作方式,验证其是否履行安全承诺,并识别盲点。他们还可以报告事件,并向公众提供更全面的关于收益和风险的信息。

需要明确的是,独立的嵌入式评估者并不会减轻我们的责任,而是帮助使这种责任更具可验证性。我们模型的安全性仍然由我们负责。

目前,对于嵌入式评估者应获取哪些信息、以及如何报告其发现结果,尚无既定标准。同样,也尚未建立资助独立评估的固定体系。从长远来看,我们认为资金应来自 pooled(联合)或政府来源,正如我们在今年6月发布的《高级人工智能框架》中所呼吁的那样。鉴于目前这两种资金来源均不存在,我们计划在不同资助安排下与不同的评估者合作。

鉴于这项工作的重要性和紧迫性,Anthropic将直接资助埃森哲的相关工作。我们还正在与METR及其他非营利评估机构进行对话,以利用他们自身的资金试点嵌入式评估的某些环节。最终,我们相信前沿人工智能需要一个在共享标准下运作的评估者生态系统。

我们期望前沿实验室能同时与多家机构合作。我们的合作并非排他性的;Anthropic将在未来几周内宣布与其他评估者的合作,而埃森哲也将以类似的方式与其他人工智能开发者合作。

我们将继续训练和发布前沿模型,并希望独立的评估者在过程中与我们并肩工作。我们现在分享这些早期努力,是为了让公众和其他人工智能开发者了解我们的流程。随着领域的成熟,我们预计自己的方法会不断演进,并将在工作启动以及引入更多评估者时分享更多信息。

原文链接:https://www.anthropic.com/news/accenture-embedded-evaluation
来源:Anthropic Newsroom
以上内容由 AI 自动翻译,仅供参考。
← 返回简报