在谷歌,我们的威胁情报团队致力于保持对现实世界中对抗性活动的领先优势,主动监控新兴威胁,防止其影响用户。目前,间接提示注入(Indirect Prompt Injection,简称 IPI)是安全社区的首要关注点,各方预计这将成为对手针对并破坏 AI 代理的主要攻击向量。然而,尽管 IPI 的危险性已被广泛讨论,但威胁行为者是否真的在今天利用这一向量——如果是,又是如何做到的呢?
为了回答这些问题并揭露现实世界中的滥用行为,我们发起了一次对公共互联网的广泛扫描,以监控已知的间接提示注入模式。以下是我们的发现。
间接提示注入的威胁
与用户“越狱”聊天机器人的直接注入不同,IPI 发生在 AI 系统处理包含恶意指令的内容(如网站、电子邮件或文档)时。当 AI 读取这些被污染的内容时,它可能会默默地遵循攻击者的命令,而不是用户的原始意图。
这并非我们新的担忧领域,谷歌一直在不懈地努力应对这些威胁。我们的工作涉及谷歌 DeepMind (GDM) 的研究人员与 Google Threat Intelligence Group (GTIG) 等防御者之间的跨职能协作。我们此前曾详细阐述过我们在这一领域的工作,研究人员也进一步强调了这些漏洞的不断演变性质。
尽管各方都聚焦于此,但一个根本性问题仍然存在:现实世界中的恶意行为者在多大程度上目前正在将此类攻击付诸实践?
谷歌的主动监控
互联网上的 IPI 格局
攻击者可能通过多种渠道尝试发送提示注入。然而,有一个位置特别易于观察——公共互联网。在此,威胁行为者可能会在网站上植入提示注入,希望污染浏览这些网站的 AI 系统。
公开研究证实了此类攻击的可能性;因此,我们应预期现实世界中的对手会利用这些漏洞造成危害。
因此,我们提出一个基本问题:今天的真实攻击者试图达成什么目标?
为了便于访问和复现,我们选择使用 Common Crawl,这是一个收录了来自英语互联网爬取网站的大型存储库。Common Crawl 每月提供约 20 亿至 30 亿页的快照。这些大多是静态网站,包括自我发布的内容,如博客、论坛以及这些站点上的评论,但需要注意的是,它不包含大多数社交媒体内容(例如 LinkedIn、Facebook、X……),因为 Common Crawl 会跳过设有登录墙和反爬指令的网站。
这意味着,尽管在社交媒体上已观察到提示注入,但我们将其留待即将发布的单独研究中讨论。作为初步观察,我们甚至可以在标准 HTML 中观察到提示注入,而 Common Crawl conveniently 不仅提供了源代码,还提供了解析后的纯文本。
误报的挑战
扫描大量文档以查找提示注入的任务听起来很简单,但在现实中却受到大量误报检测的阻碍。
早期实验揭示了大量“良性”提示注入文本,这说明了区分功能性威胁和无害内容的复杂性。许多提示注入被发现于研究论文、教育博客文章或讨论这一主题的安全文章中。