在谷歌,我们的威胁情报团队致力于保持对现实世界对抗性活动的领先优势,主动监控新兴威胁,防止其影响用户。目前,间接提示注入(Indirect Prompt Injection,IPI)是安全社区的首要关注点,各方预计这将成为对手针对并破坏 AI 代理的主要攻击向量。然而,尽管 IPI 的危险性被广泛讨论,但威胁行为者是否真的在利用这一向量——如果是,又是如何做到的呢?
为了回答这些问题并揭露现实世界中的滥用行为,我们发起了一次对公开网络的广泛扫描,以监控已知的间接提示注入模式。以下是我们的发现。
间接提示注入的威胁
与用户“越狱”聊天机器人的直接注入不同,IPI 发生在 AI 系统处理包含恶意指令的内容(如网站、电子邮件或文档)时。当 AI 读取这些被污染的内容时,它可能会 silently 遵循攻击者的命令,而不是执行用户的原始意图。
这并非我们全新的担忧领域,谷歌一直在不懈努力以应对这些威胁。我们的工作涉及谷歌 DeepMind(GDM)的研究人员与 Google Threat Intelligence Group(GTIG)等防御团队之间的跨职能协作。我们此前曾详细阐述过我们在这一领域的工作,研究人员也进一步强调了这些漏洞不断演变的性质。
尽管各方对此高度关注,但一个根本性问题依然存在:现实世界中的恶意行为者目前在多大程度上正在实际部署这些攻击?
谷歌的主动监控
网络上的 IPI 格局
攻击者可能通过多种渠道尝试发送提示注入。然而,有一个位置特别易于观察——公开网络。在此,威胁行为者可能会在网站上植入提示注入,希望借此破坏浏览这些网站的 AI 系统。
公开研究证实了这些攻击是可行的;因此,我们应预期现实世界中的对手会利用这些漏洞造成危害。
因此,我们要问一个基本问题:现实中的攻击者目前试图实现什么目标?
为了便于访问和复现,我们选择使用 Common Crawl,这是一个收录了来自英语网络的大量爬取网站的大型存储库。Common Crawl 每月提供 20 亿至 30 亿个页面的快照。这些页面主要是静态网站,包括自我发布的内容,如博客、论坛以及这些网站上的评论;但需要指出的是,由于 Common Crawl 会跳过设有登录墙和反爬指令的网站,因此它不包含大多数社交媒体内容(例如 LinkedIn、Facebook、X 等)。
这意味着,虽然我们在社交媒体上观察到了提示注入,但我们将其留待后续单独的研究中探讨。作为初步观察,我们甚至可以在标准 HTML 中观察到提示注入,而 Common Crawl conveniently 不仅提供了源代码,还提供了解析后的纯文本。
误报的挑战
扫描大量文档以查找提示注入的任务听起来很简单,但实际上却因海量的误报检测而受阻。
早期实验揭示了大量“良性”的提示注入文本,这说明了区分功能性威胁和无害内容的复杂性。许多提示注入被发现于研究论文、教育性博客文章或讨论这一主题的安全文章中。