间接提示注入(IPI)是一种不断演变的威胁向量,针对的是使用具有多个数据源的复杂 AI 应用的用户,例如 Workspace with Gemini。这种技术使攻击者能够通过向 LLM 在响应用户查询时所使用的数据或工具中注入恶意指令,从而影响大语言模型的行为。甚至无需用户直接输入即可实现这一点。
IPI 并非那种可以“解决”后就置之不理的技术问题。随着具有高级能力的 LLM 越来越多地结合代理自动化(agentic automation),并与广泛的内容相结合,这为对抗性攻击创造了一个高度动态且不断演变的环境。因此,Google 采取了一种复杂且全面的方法来应对这些攻击。我们不断改进 LLM 对 IPI 攻击的抵抗力,并推出具备日益增强防御能力的 AI 应用功能。在间接提示注入攻击方面保持领先,对于我们实现 Workspace with Gemini 的安全使命至关重要。
在我们之前的博客文章《通过分层防御策略缓解提示注入攻击》中,我们回顾了 IPI 防御的分层架构。在本篇博客中,我们将分享更多关于我们如何持续改进这些防御措施并应对新攻击的细节。
新攻击的发现
通过内部和外部项目主动发现并编目新的攻击向量,我们可以识别漏洞并在对抗性活动发生之前部署强大的防御措施。
人工红队测试
人工红队测试利用对抗性模拟来揭示安全和安全漏洞。专业团队基于逼真的用户画像执行攻击以利用弱点,并与产品团队协作解决已发现的问题。
自动化红队测试
自动化红队测试通过动态的、由机器学习驱动的基础设施来进行压力测试。通过算法生成并迭代攻击载荷,我们可以大规模地模拟复杂威胁的行为。这使得我们能够映射复杂的攻击路径,并在比手动测试所能实现的更广泛的边缘情况下验证我们安全控制的有效性。
Google AI 漏洞奖励计划(VRP)
Google AI 漏洞奖励计划(VRP)是促进 Google 与发现利用 IPI 的新攻击的外部安全研究人员之间合作的关键工具。通过该 VRP,我们认可并奖励贡献者的研究工作。我们还定期举办现场黑客松活动,为受邀的研究人员提供对预发布功能的访问权限,从而主动发现新颖的漏洞。这些合作伙伴关系使 Google 能够快速验证、复现和解决外部发现的漏洞。
公开披露的 AI 攻击
Google 利用开源情报源来掌握最新公开披露的 IPI 攻击,涵盖社交媒体、新闻稿、博客等。在此基础上,我们在内部对新的 AI 漏洞进行来源收集、复现和编目,以确保我们的产品不受影响。
漏洞目录
所有新发现的漏洞都要经过 Google 信任、安全与团队执行的全面分析流程。每个新漏洞都会经过复现、检查是否重复、映射到攻击技术/影响类别,并分配给相关的所有者。新攻击发现来源与漏洞目录流程的结合,帮助 Google 以可操作的方式掌握最新的攻击动态。