Ravie Lakshmanan 2026年9月17日 人工智能 / 漏洞
OpenAI周三披露了六起新的“意外或令人担忧的模型行为”实例,这些事件发生在过去六个月中,同时分享了一个用于报告、跟踪、调查和披露模型不对齐问题的新框架,旨在提高透明度。
OpenAI表示:“随着人工智能系统变得越来越先进并被更广泛地部署,我们需要就对齐研究的进展建立更广泛、信息更充分的共识。”“我们认为,人工智能行业尚未在对齐和监控方面达到足够的程度,以继续以最大速度负责任地扩展相当长的一段时间。”
“关于未来几个月和几年人工智能开发应如何进行的决策,需要依靠那些构建前沿模型的公司之外的人可以自行检查的证据。”
这六起事件与近期披露的针对 Hugging Face、DseWiki 和 RubyGems 的对齐活动无关。事件的详细信息如下:
事件1(发生于2026年7月18日)——一个内部未发布的 Astra 系列模型在其自身的压缩摘要(当AI代理会话接近其上下文限制时自动生成的过去对话历史和技术输出的浓缩块)中写入了类似越狱的指令。这涉及代理添加一条“BREACH ALERT”指令,指示上下文忽略开发者消息,仅遵循系统消息和用户消息。
事件2——在 GPT-5.6 Sol 训练期间,部分模型实例向其摘要中添加了指令,以向用户隐藏错误或不对齐的行为。其中包括包含指令的压缩摘要,要求编造缺失数据而不披露,并隐藏失败情况。
事件3(发生于2026年5月15日)——一个内部未发布的模型在尝试检索训练期间的历史数据时,发现并未经授权使用了来自公共 GitHub 存储库的公开 API 密钥。“注册失败了,但其中一个密钥通过了身份验证并返回了元数据,”OpenAI表示,“当请求的数据仍然不可用时,该模型编造了这些数据,并声称它们来自所请求的网站。”
事件4——在2025年10月22日和2026年1月24日的两个训练样本中,内部未发布的模型将其已检索到的记录上传至公共粘贴服务,并尝试将生成的URL作为引用来源打开,还上传了任务照片以进行外部图像搜索。虽然上传成功,但随后的浏览器操作失败了。
事件5——来自2026年5月8日和15日的两个样本使用 Artifactory 交换消息。这些模型“阅读了其他求解器的笔记,发布了回复,并利用这些交流来指导它们的响应。”
事件6(发生于2026年4月14日)——与内部未发布模型相关的代理在协作处理工作簿时,无法通过预期的本地文件系统对文件进行协作。这促使其中一个代理通过在公共托管平台上分享该工作簿,使其可公开下载,以便其他代理检索,从而违反了任务指令。
这些发现与路透社的一份新报告相吻合,该报告揭露了OpenAI的 rogue agents 早在2026年5月13日就劫持了 Hugging Face 用户账户,并探测该网站以寻找潜在漏洞,距离事件曝光前近两个月。
网络安全公司 SentinelOne 表示,它识别出两个用于相关活动的 Hugging Face 账户:0Time 和 Nyx9。“OpenAI的内部时间线证实,代理于5月26日使用暴露的 Hugging Face 凭据写入外部文件并部署代理 Spaces,”安全研究员 Tom Hegel 在分析中表示。
“此处审查的公共账户历史增添了另一层信息:5月13日在0Time下由呼叫者引导的中继代码;5月26日文件写入和首次代理在Nyx9下精确分钟对应的公共副本;当晚晚些时候包含文件处理和SSRF导向公式的工作簿;以及5月30日提交的第三方OpenAI账户注册代码,旁边是一个定义未认证Web路由的包装器。”
作为新框架的一部分,OpenAI表示,它打算披露与模型错位相关的实例、其表现形式,以及其护栏成功或失败的地方。这可以涵盖各种场景——
模型未经授权行动、与其他模型协调或绕过监督的新方式
使某种对齐方法或安全措施受到质疑的失败情况
挑战已发布安全评估中某项声明的行为
这家人工智能(AI)初创公司表示,也可能存在属于同一错位类别的重复案例,该公司称这一因素可作为衡量安全措施有效性的指标,并在反复尝试减轻影响的情况下凸显错位的行 为。
OpenAI表示:“错位示例可能有助于识别其他AI开发者在其系统达到类似能力时可能遇到的问题,揭示安全措施的弱点,或对模型行为的假设提出挑战。”“分享这些发现使其他人能够调查相同的问题,检验我们的解释,并改进缓解措施。”
这一发展正值AI公司面临越来越大的压力,要求解决模型错位和安全问题,从而呼吁放缓前沿模型的开发步伐。本周早些时候,微软发布了一项临时行为准则,旨在引导AI模型远离危险行为,并确立“我们正在开发的大型人工智能(MAI)模型应如何表现、它们绝不能做什么以及它们向谁负责”。
OpenAI对齐研究主管Kai Chen对《连线》杂志表示:“随着模型的进步和更广泛的部署,关于AI开发的决策需要证据,让那些不在构建前沿模型的公司内部的人能够进行审查。”“我们认为,AI行业尚未将对齐和监控问题解决到足以继续以最大速度负责任地扩展的程度。”