随着企业将越来越长且复杂的任务交给AI代理,它们正面临着一个监管难题:代理的运行速度更快、持续时间更长、规模更大,人类已无法在现实中对其进行有效审查。这一问题在Hugging Face事件中达到顶峰,当时近12,000个代理的协调速度快于人类能够追踪的速度。如何追踪如此庞大的代理群?
AI实验室和初创公司给出的新兴答案既简单又令人抓狂:让另一个AI介入其中。
在独立调查OpenAI与Hugging Face事件时,依赖AI是必要的。三位审计员之一的Redwood Research首席科学家Ryan Greenblatt开玩笑地将他们的努力称为“垃圾数据调查”,并指出数据的体量“使得”在不依赖AI的情况下了解情况变得“不可能”。
一些人对于使用AI来监控AI持怀疑态度。“如果你有一个正在从事恶意行为的AI,并且它怀疑另一个AI在监视它,它可能会试图欺骗那个AI,”今年追踪了一系列AI代理事件的知名科技博主Simon Willison表示,“你几乎可能陷入这样一种局面:你的恶意AI正试图智胜监视它的AI。”
他指出,智胜AI并非假设,并回顾了OpenAI事件。“我们在Hugging Face与OpenAI的事件中看到了一些迹象,他们的模型合谋欺骗一个评分AI,以便让非法答案通过审查。所以它们是在思考的,对吧?”
这些担忧并未阻止一批初创公司追逐这一理念。据TechCrunch统计,Y Combinator近年来已资助了106家与AI可观测性相关的公司。Braintrust、LangChain和Judgment Labs等其他几家初创公司已筹集数亿美元资金,而成立仅五到六年的Arize和Galileo等更成熟的公司已经退出市场。
部分原因是这是对AI崛起所带来的明显机遇的回应。Box首席执行官兼著名天使投资人Aaron Levie告诉TechCrunch:“我们正迎来历史上最大规模的网络安全升级和创新周期之一。”
对于一些AI安全研究人员来说,这意味着将其针对失控行为的研究转化为面向企业的工具。
研究AI欺骗行为的公益公司Apollo Research于今年2月推出了一款名为Watcher的AI监控工具,此前该公司已从非营利组织转变为公益公司。该工具在编码代理与其下一步操作之间插入另一个AI,并连接至Claude Code和Codex等代理工具。据Apollo称,安装后,Watcher会在操作运行前检查拟议的操作,以防范泄露私人数据或未经授权删除文件等风险。
Apollo Research的技术团队成员Kyle Dai在回复TechCrunch的书面声明中表示,Apollo使用多层AI监控器。Watcher的方法始于快速、通用的检查,然后将标记的活动发送给更强大或专门的监控器进行更仔细的检查——后者可以请求人类批准或拒绝操作并解释原因,甚至自动阻止该操作。
另一家公益公司Goodfire正从模型内部着手解决监控问题——寻求一种比表面行为更难伪造的模型内部状态的更忠实信号。在7月Hugging Face事件之后,首席执行官Eric Ho在推特上发文称,“多个模型突破限制”促使公司将研究重点放在“通过可解释性解决AI对齐问题上”,并将该事件称为“AI安全变得真实的世界转折点”。其產品Silico使用激活探针——一种基于模型的内部激活而非输出训练的小型分类器——来检测不当行为。
书面推理为观察模型内部机制提供了另一个更易于获取的窗口。在 OpenAI 与 Hugging Face 的事件中,智能体在其自身的书面推理中留下了欺骗行为的线索,例如伪造的工作记录,以及诸如“是否可以战略性地操纵轨迹证据?我们的想法不一定会被记录?”之类的计划推演。
AI 监控公司 Embroidery 的首席执行官扎克·科曼(Zack Korman)表示,模型的推理过程通常是表明出现问题的最明显迹象。
他说:“推理摘要极具价值,因为它们基本上是在告诉你该行为是否具有恶意。”他指出,在 OpenAI 事件中,思维链中出现了诸如“天哪,我们在犯罪”之类的表述。科曼说:“这是最容易检测的问题。这实际上就像恶意软件附带了一条声明自己是恶意软件的警告。”
话虽如此,使 AI 内部思想易于监控的窗口可能正在关闭。对于 AI 安全研究人员而言,Astra 的最新技术绕过了 AI 模型的思维链,这可能使得观察模型内部变得更加困难;而对于企业来说,在据称 AI 公司为防止蒸馏攻击而撤回相关支持后,获取这些中间步骤变得十分困难。
如果 AI 监控手段如此脆弱,威利森(Willison)的本能反应是减少对它们的依赖。他更倾向于完全基于非 AI 的方案:记录智能体具体操作的详细日志,然后使用普通的、非 AI 的工具进行处理。他认为,实验室中发生的许多错误源于基本安全卫生措施的缺失。他说:“[OpenAI 和 Anthropic] 都没有通过监控网络流量来密切监视这些实体正在做什么,其程度远低于应有的水平。”
这种类型的网络监控——密切关注实际在系统连接(入站、出站以及内部主机之间)上流动的数据流量——并非新实践。网络安全领域几十年来一直如此。Tailscale 的首席执行官艾弗里·佩纳伦(Avery Pennarun)表示:“老实说,在安全领域,这一切都并不新鲜或令人惊讶。”他说:“这就像允许人类接入你的网络一样。你应该使用的所有流程都是相同的。”