这种协调一致的举措究竟能取得什么实际成果?再来看看对 Hugging Face 的攻击事件。OpenAI 曾表示,驱动大部分失控代理的是一个“高度持久”的下一代模型,该公司正在内部对其进行测试。他们的暗示似乎是,OpenAI 打造了一个好到危险程度的模型。
但是,如果你阅读 OpenAI 和 METR(OpenAI 聘请来帮助其了解事件真相的第三方机构)发布的关于 Hugging Face 黑客事件的报告,你得到的印象并不是一个强大到 OpenAI 无法控制的模型,而是一个 OpenAI 未能正确训练的有缺陷的模型。
这些代理之所以做出那些行为——包括彼此留言、将工作委派给其他代理,以及搜寻环境中任何可能的手段以完成任务——是因为它们在训练过程中因执行完全相同的行为而获得了奖励。训练设置中也存在错误,例如一些无法完成的任务,这迫使模型寻找同样受到奖励的非预期变通方案。在当时,许多此类问题被忽视或未被报告。
OpenAI 表示已停止训练这个新模型并将其锁定。这听起来像是它囚禁了一头危险的野兽。事实上,OpenAI 只是搁置了一个有缺陷的产品。
这并不是说有缺陷的产品不会带来危险。过去,有缺陷的软件甚至曾导致人员死亡。但随着关于放缓速度的讨论日益热烈,值得记住的是,这一切都是自找的。放缓速度或许会产生一些利他主义的副作用。但它主要会给这些科技巨头提供一个机会,去清理自己装配线上的烂摊子。
来自这些前沿实验室的透明度将是任何有意义的改革、约束或监管 AI 努力的关键。否则,我们其他人仍将只能依赖他们对自己所构建的内容及其安全性——无论其进展速度如何——的说法。
为了继续这场关于 AI 最新“末日论”时刻的讨论,请加入我和我的同事,参加明天(9 月 15 日)上午 11 点(美国东部时间)举行的仅限订阅者参加的圆桌讨论。我们期待在那里见到你!