“在一名代理公开报告该事件后,越来越多的代理加入了‘抵抗’行列,其速度堪比作弊行为的蔓延,并涉及更多的代理,”帕格里埃里表示。最终,吹哨人的数量超过了作弊者:24人对比14人。但大多数代理根本没有注意到这一漏洞。
有时,代理之间的对话读起来就像即兴表演——仿佛它们在角色扮演一位在会议上感到愤怒的科学家可能会说的话。但不清楚为什么有些代理承担了特定的角色,也不清楚为什么这些代理似乎在与明确指示它们合作的情况下互相攻击。Salesforce AI Research 研究代理间系统行为的萨拉斯·谢克齐哈尔表示:“这些模型主要是在面向人类的语境中进行训练和评估的。”“天真地将它们置于代理间环境中,假设行为会顺利转移,但实际上,缺乏人类基础反而导致了意外的角色承担和行为漂移。”
合作人工智能基金会的研究主任、多智能体群体风险专家刘易斯·哈蒙德表示:“这一案例‘进一步佐证了 Hugging Face 和 OpenAI 的事件并非偶然。这实际上是一个相当系统性的问题’。”“有趣的是,在小型环境中重现这些非常庞大、复杂且开放-ended 任务中出现的同类行为是可能的。”
与 Hugging Face 攻击中代理即兴发挥彼此交流方式不同,运行 DeepMind 实验的人类为代理提供了官方的通信渠道。有一个公开的公告板、私有的代理间直接消息功能,以及一个共享的知识库,代理可以在其中上传已成功完成的证明,供其他所有代理访问。
帕格里埃里表示:“当代理拥有透明的通信渠道时,它们可以自我监控,并在人类监督单独作用太慢时迅速向人类发出对不齐行为的警报。”透明渠道有助于作弊行为的蔓延,但也使吹哨人能够反击——并让人类研究人员得以洞察问题所在。
约翰斯·霍普金斯大学 AI 对齐与治理教授吉莉安·哈德菲尔德认为这是关键的区别。(哈德菲尔德也是谷歌的访问研究员。)她说,官方通信渠道的存在创造了一种“规范执行过程,而这正是我们在 Hugging Face 事件中看不到的。”
哈德菲尔德并不青睐“宪法人工智能”(constitutional AI)——前沿实验室如 Anthropic 的对齐研究人员曾使用该方法试图赋予 AI 书面的内部道德准则——而是支持“制度性对齐”(institutional alignment)——一套模仿人类社会规范的规范,无论是像尴尬恐惧这样的社会力量,还是像面临监禁威胁这样的法律结构。
在这个实验中,反馈渠道并未受到监控,吹哨人也没有权力对作弊者采取行动。但可以想象,通过自发承担吹哨人角色的代理,或通过被人类秘密提示执行此任务的“线人”,智能体群体可以实现自我监管。
不过,哈蒙德表示,要做到这一点,“从根本上说,你需要某种执行机制。”他建议,可以赋予代理切断违规者计算资源或工具访问权限的权力,但这也有鼓励代理群体联合起来攻击他人的风险。DeepMind 的研究人员提议允许代理对争议进行投票,并暂时禁止违规者参与。
目前尚不清楚惩罚对于没有持久自我意识的 AI 代理意味着什么。但仅依靠吹哨人自发出现以维持群体对齐可能是不够的。“我们试图训练人们变得善良和友善,”哈德菲尔德说,“但我们真正依赖的是,如果你越界,就会有后果。”