在谷歌,我们的威胁情报团队致力于始终领先于现实世界中的对抗性活动,主动监控新兴威胁,防止其影响用户。目前,间接提示注入(Indirect Prompt Injection,简称 IPI)是安全社区的首要关注点,各方预期它将成为对手针对并破坏 AI 代理的主要攻击向量。然而,尽管 IPI 的危险性被广泛讨论,但威胁行为者是否真的在利用这一向量进行攻击?如果是,他们是如何做到的?
为了回答这些问题并揭示现实世界中的滥用行为,我们发起了一次对公开网络的广泛扫描,以监控已知的间接提示注入模式。以下是我们的发现。
间接提示注入的威胁
与用户“越狱”聊天机器人的直接注入不同,IPI 发生在 AI 系统处理包含恶意指令的内容(如网站、电子邮件或文档)时。当 AI 读取这些被污染的内容时,它可能会默默地遵循攻击者的命令,而不是执行用户的原始意图。
这并非我们新的关注领域,谷歌一直在不懈地努力应对这些威胁。我们的工作涉及谷歌 DeepMind(GDM)的研究人员与 Google Threat Intelligence Group(GTIG)等防御团队之间的跨职能协作。我们此前曾详细阐述过我们在这一领域的工作,研究人员也进一步强调了这些漏洞的不断演变性质。
尽管各方对此高度关注,但一个基本问题仍然存在:现实世界中的恶意行为者在多大程度上目前正在实际部署这些攻击?
谷歌的主动监控
网络上的 IPI 格局
攻击者可能通过多种渠道尝试发送提示注入。然而,有一个位置特别易于观察——公开网络。在此,威胁行为者可能会简单地在网站上植入提示注入,希望污染浏览这些网站的 AI 系统。
公开研究证实了这些攻击是可能的;因此,我们预期现实世界中的对手会利用这些漏洞造成危害。
因此,我们提出一个基本问题:当前的真实攻击者试图实现什么目标?
为了便于访问和复现,我们选择使用 Common Crawl,这是一个收录了大量来自英语网络爬取网站的大型存储库。Common Crawl 每月提供 20 亿至 30 亿个页面的快照。这些大多是静态网站,包括自我发布的内容,如博客、论坛以及这些网站上的评论。但需要指出的是,由于 Common Crawl 会跳过设有登录墙和反爬指令的网站,因此它不包含大多数社交媒体内容(例如 LinkedIn、Facebook、X 等)。
这意味着,尽管在社交媒体上已观察到提示注入现象,但我们将其留待后续单独研究。作为初步观察,我们甚至可以在标准 HTML 中观察到提示注入,而 Common Crawl conveniently 不仅提供了源代码,还提供了解析后的纯文本。
误报的挑战
扫描大量文档以查找提示注入的任务听起来很简单,但在现实中却受到大量误报检测的阻碍。
早期实验揭示了大量“良性”的提示注入文本,这说明了区分功能性威胁和无害内容的复杂性。许多提示注入被发现于研究论文、教育性博客文章或讨论这一主题的安全文章中。