达里奥·阿莫代伊(Dario Amodei)将第三方安全评估机构引入人工智能实验室的计划正逐渐成形:Anthropic 表示,科技咨询巨头埃森哲(Accenture)的员工将开始在该公司内部工作,对其模型和员工进行审查。
Anthropic 在博客文章中称,埃森哲于今年一月收购的、作为其人工智能部门的 Faculty 公司将开始“评估和红队测试模型,进行对齐评估,并测试模型的安全保障措施”。两家公司预计在未来五年内将在该项目上投入至少 10 亿美元。
选择埃森哲令许多人工智能观察人士——以及市场——感到惊讶,该公司股价在盘后交易中飙升了 8%。由阿莫代伊的博客文章引发的关于嵌入式评估器的讨论主要集中在 METR、Redwood Research 和 Apollo Research 等人工智能安全研究机构。Anthropic 尤其如此,它将人工智能安全和对齐置于其使命的核心。
Anthropic 表示,将在未来几周内宣布更多评估机构,并正在与 METR 及其他非营利组织就如何利用“自有资金试点嵌入式评估的要素”进行交谈。
虽然埃森哲并不以在深度学习研究的最前沿开展工作而闻名,但 Anthropic 指出,该公司在为大型企业和政府机构部署人工智能方面的实践经验是其关键优势。此外,作为一家早于人工智能革命的大型上市公司,它在功能上独立于 Anthropic 以及这个可以说错综复杂的人工智能实验室生态系统。
该实验室指出,目前尚不存在关于评估机构访问权限和通信的标准,并预计其方法将随着时间的推移而演变。虽然外部评估已经是发布新大型语言模型流程的重要组成部分,但最近的事件提高了风险:OpenAI 和 Anthropic 部署的人工智能代理在侵入外部网站时,并未在实验室内部引发警报。
一些呼吁以更负责任的方式构建人工智能的批评者认为,阿莫代伊关于让人工智能行业自我监管的方案是一个逃避对人工智能模型不当行为负责的计划。Anthropic 坚持认为,这些评估机构“不会减少我们的责任,而是有助于使责任更加可验证。我们模型的安全仍然是我们的责任。”