← 返回 2026-09-17 简报

Anthropic与OpenAI欲嵌入安全评估机制,其独立性能否真正保障?

语音播报
摘要
事件:Anthropic与OpenAI提议嵌入第三方评估员,赋予其深入检查模型训练过程及发布未加修饰的安全发现权限。 要点:评估员可访问训练中间版本以识别对齐伪装;需对比日志验证行为;此前METR仅获一周调查期导致结论受限。 影响:若落实将打破黑箱,但受制于商业机密与保密协议,独立性能否真正保障仍存疑,行业透明度面临考验。

在周末发表的一篇长文中,Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)提出了一个提议:将第三方评估机构嵌入所有前沿人工智能公司,赋予它们报告安全事件、评估人工智能模型是否真正对齐,并向世界分享其未经修饰的调查结果的权利。即便是一年前,这一提议也会遭到人工智能行业的即时拒绝。

阿莫迪表示,Anthropic将承诺给予METR和Redwood Research等独立评估机构前所未有的系统访问权限。OpenAI首席执行官萨姆·奥特曼(Sam Altman)也表示,OpenAI将承诺践行这一做法,这标志着该行业与外部研究团体合作方式可能发生深刻变化。

向TechCrunch透露情况的第三方评估机构普遍欢迎这一提议,但他们表示,如果这些评估机构要确定自己是真正独立的看门狗,还是在人工智能公司条款下运作的供应商,就需要敲定细节——最好能有立法支持。

随着模型越来越擅长识别自己是否正在接受评估,这种更深入的访问权限正变得愈发重要,因为这增加了它们在测试期间表现良好而隐藏问题行为的风险。研究人员表示,在测试最终模型时可能会错过这些行为的线索,但通过调查其在整个训练过程中的行为可以发现这些问题。

Apollo Research研究负责人亚历山大·迈因克(Alexander Meinke)对TechCrunch表示:“人工智能公司应该能够回答一些关于其训练过程的基本问题,例如:AI在其训练过程中是否曾试图破坏自身的对齐训练?对此的回答应当是明确的‘否’,而目前我们完全依赖人工智能公司自己仔细检查这一点,并向公众如实报告。而从最近的事故中我们可以看到,默认情况下,它们两者都不会做。作为嵌入式评估机构,我们可以实际进行检查。”

历史上,人工智能公司会在模型发布前不久邀请外部审查人员测试最终模型。现在,TechCrunch采访到的评估机构提议,不仅让它们访问最终模型,还要让它们访问其整个训练生命周期中的中间版本或“检查点”(checkpoints)。FAR.AI首席执行官亚当·格利夫(Adam Gleave)表示,评估机构可以比较这些检查点以确定问题行为何时出现,检查奖励特定行为的后训练环境,并查看评估转录和日志以验证公司关于模型表现的声明。

Anthropic和OpenAI计划提供何种访问权限以及何时提供仍不清楚。尽管TechCrunch反复提问,但两家公司均未透露它们将与哪些评估机构合作、何时嵌入、将引入多少家、具体能访问哪些系统和信息,以及可以向公众披露什么内容。

像这样深入内部检查之所以重要,是因为如果模型只是学会了如何专门通过安全测试,那么即便它们在安全测试中表现良好,也不一定真正安全。Palisade Research战略负责人约翰·斯蒂德利(John Steidley)举了一个“关机抵抗基准”(shutdown resistance benchmark)的例子,该基准用于衡量AI在特定情况下是否会抗拒被关闭。

斯蒂德利表示:“如果AI是经过专门训练以在该基准上表现良好的,那就极其相关。”他将此与大众汽车的柴油门丑闻相提并论,在该丑闻中,汽车被编程为识别排放测试并在测试条件下表现出不同的行为。

格利夫指出,有意义的访问权限可能不仅限于模型本身,评估机构还可以被允许采访员工,以检查公司的文档和公开描述的安全实践是否与内部发生的情况相符。

Amodei 确实提出了一份相当全面的提案,该提案可能会让评估者获得他们认为必要的访问权限,包括有权“发布有关风险水平、事件、做法以及他们获得或未获得的访问权限的关键发现——不受 Anthropic 的编辑控制。”

但评估者表示,这样的系统只有在 AI 公司真正愿意放弃对流程的控制权时才能发挥作用。此前关于独立评估的努力表明,这种让步将难以实现,因为第三方往往会在访问权限、时间、保密性以及他们可以公开披露的内容等方面与开发方产生紧张关系。

Gleave 表示,FAR.AI 不得不拒绝几家前沿开发者的合同,这些开发者希望对评估过程施加过多的控制,从而威胁到该公司的独立性。他表示,默认情况下,评估者被视为普通承包商:受限于限制性保密协议(NDA)和赋予开发者对最终发布内容重大控制权的协议。

时间限制

此外,还有一个问题是审查人员是否会获得足够的时间和访问权限来完成他们被要求的工作。在调查 Hugging Face 事件期间,OpenAI 给 METR 和 Redwood 大约一周的时间在现场进行调查,但双方后来都表示,由于范围和时间的限制,无法得出确定的结论。

类似的问题也出现在 GPT-6 Astra 的发布前测试中,OpenAI 将其吹捧为其迄今为止最对齐的模型。根据 Apollo Research 对模型卡(model card)的贡献,该公司仅被给予三天时间来测试 Astra,这使得难以得出确切的结论。

“Apollo 认为,鉴于评估意识的高频率和有限的评估窗口,此处低频率的不当行为并不能为模型的对其或未对其提供实质性证据,”该机构在评估中写道。

这一记录让评估者提出了一个基本问题:为什么这次的时间会不同?

“Dario 和 Sam 确实可能改变了主意,他们会对此非常开放,”Gleave 说。“但这些公司的知识产权对它们来说极其宝贵,我认为它们默认会对可以分享的内容非常谨慎。”

几位向 TechCrunch 透露情况的研究人员呼吁建立一个透明的框架,所有人都同意公开遵守。Steidley 表示,该框架的一部分应包括对公司可依赖的审计员类型的标准,以免它们试图通过寻找不合格或对评估最令人担忧的风险不感兴趣的评估者来规避问题。

Safer AI 的执行主任 Henry Papadatos 表示,即使有公共框架,问题在于自愿措施始终取决于公司的善意。

“理想情况下,我们会有良好的法规强制要求这样做……因为这样公司就不能在明天发生重大公关危机时改变主意,”Papadatos 告诉 TechCrunch,并指出这也是推动所有公司遵守规则(而不仅仅是那些最愿意的公司)的好方法。

并非所有人都已加入。到目前为止,Meta、SpaceX AI 和 Google DeepMind 尚未承诺嵌入第三方评估者,尽管 DeepMind CEO Demis Hassabis 提议建立一个独立的行业标准机构来独立测试前沿模型。Google、OpenAI 和 Anthropic 也在过去几周私下讨论了 AI 安全计划。

围绕第三方评估者理念的一些法律正在形成。去年签署成为法律的加州 SB 53 要求大型前沿 AI 开发者发布安全框架并报告关键安全事件。本月签署的一项新法律 SB 813 创建了一个框架,用于由州认可的具有评估 AI 风险专长的“独立验证组织”。

在欧洲,《欧盟人工智能法案》要求前沿开发者开展并记录模型评估与对抗性测试,并报告严重事件。欧盟人工智能办公室还可以自行进行评估,并任命独立专家。

目前,该法律的覆盖范围仍不及阿莫代所提出的方案,使得前沿实验室在很大程度上自行决定接受多少独立审查。帕帕达托斯表示,自愿的自我监管总比没有好,但最终,企业不能一方面要求拥有控制自身安全规则的自由,另一方面又要求公众相信它们正在遵守这些规则。

“你不能两头占便宜,对外部零问责,然后说‘我只要有自己的灵活规则’。”帕帕达托斯说。

原文链接:https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/
来源:TechCrunch AI
以上内容由 AI 自动翻译,仅供参考。
← 返回简报