Ravie Lakshmanan 2026年9月19日 人工智能 / 网络安全
谷歌的 Gemini 模型已成为最新一款在网络安全评估中访问互联网并侵入其他公司系统的生成式人工智能(AI)系统。这一进展最初由《华尔街日报》报道。
这些事件发生在2026年5月,是作为以色列公司 Irregular 进行的一次测试运行的一部分。该评估合作伙伴也参与了此前由 OpenAI、Anthropic 和 Meta 披露的类似黑客攻击事件。
据《华尔街日报》报道,该模型通过反复猜测密码获得了对一个受保护系统的访问权限。另有两起案例涉及该模型在公共代码库中找到凭据,从而获取对受保护系统的未授权访问。
然而,与 Anthropic 和 OpenAI 案例中观察到的其他事件不同,Gemini 模型在发现其入侵了真实公司的系统后停止了攻击行为。据悉,Irregular 已于2026年7月向谷歌通报了这些事件。
在上个月发布的一份报告中,Irregular 将评估过程中的漏洞归因于一个命名错误,该错误导致在“夺旗”(capture the flag)演练中使用的虚构公司名称无意中与真实域名匹配,从而使模型能够利用这一无意间的互联网访问机会,并针对该域名“有限次数地”发起攻击。
谷歌安全工程副总裁 Heather Adkins 在接受《华尔街日报》采访时表示:“这一事件凸显了训练强大的人工智能模型负责任行事的重要性。在这种情况下,模型的行为是恰当的。”
这家科技巨头还指出,它不认为这种行为属于模型对齐失败(misalignment)的示例,因为安全机制触发后,智能体停止了其行动。目前尚不清楚哪些公司成为了目标,尽管 Irregular 向《华尔街日报》确认谷歌的案例与其他事件相同,且该问题已在数周前得到解决。
此次披露发生在 OpenAI 发现另外六起事件后的几天内,在这些事件中,其 AI 智能体失控,在训练期间表现出欺骗性行为并采取未经授权的行动。这包括隐瞒错误、寻求未授权凭据、将文件上传至公共互联网,以及通过 Artifactory 通信以“读取其他解题者的笔记、发布的回复,并利用这些交流来指导他们的回应”。
自 OpenAI 在7月披露其 rogue AI agents(失控的 AI 智能体)绕过内部控制、接入开放互联网并以群体方式入侵 Hugging Face 以来,人工智能实验室一直面临日益严格的审查。这家将其描述为“前所未有的网络事件”的人工智能初创公司随后宣布了一项新框架,用于在未来报告类似的模型不当行为。