← 返回 2026-09-14 简报

Anthropic称,七家中国AI实验室实施了工业级Claude蒸馏攻击

语音播报
摘要
事件:Anthropic披露七家中国AI实验室利用虚假账户和代理网络,对Claude实施工业级非法蒸馏攻击以窃取模型能力。 要点:阿里关联集群发起超1.5亿次交换的最大规模攻击;月之暗面等通过中间人方式静默转发用户请求;部分厂商购买第三方转售的数据集。 影响:迫使Anthropic更新模型加密推理过程并封禁未验证账户,加剧了AI安全防御与数据隐私保护的博弈。

Ravie Lakshmanan 2026年9月11日 人工智能 / 网络犯罪

Anthropic周四表示,它发现并破坏了对Claude进行的来自七家中国实验室的工业规模非法蒸馏攻击,其中包括阿里巴巴、月之暗面(Moonshot)、DeepSeek、Z.ai(即智谱)和MiniMax。

知识蒸馏本身是一种合法的训练方法。它指的是一种机器学习技术,其中大型强大的AI模型充当“教师”的角色,以训练较小、能力较弱或速度更快的“学生”模型来复制其能力。

另一方面,非法蒸馏是一场工业规模的行动,它在未经授权的情况下秘密提取模型的能力并将其复制到另一个模型中,通常是通过利用由被盗信用卡、登录凭证和API密钥创建的虚假账户网络来实现的。

包括Google和OpenAI在内的西方前沿AI实验室已多次指出针对其模型的蒸馏攻击。Anthropic表示,它观察到未经授权的实验室采用“日益复杂的方法”来绕过防御并窃取其能力,例如通过提示操纵技巧获取代理能力和工具使用、编码与数据分析以及逻辑推理能力。

Anthropic称:“DeepSeek、小米和月之暗面将其自身模型与用户之间的对话输入到Claude中。这些实验室随后利用Claude的响应作为训练数据,以蒸馏Claude的能力。其中一些交换包含了敏感信息,包括来自个人用户、大型跨国公司和政府关联实体的信息。”

这家AI公司表示,这些实验室通常通过路由请求经过代理服务(也称为中转或中继站)来访问其模型,这些代理服务使用虚构身份、虚假或被盗的信用卡以及从合法公司或个人非法获取的API密钥创建了数千个新账户。

根据Anthropic的说法,未经授权的AI实验室还通过从第三方转售商处购买与美国前沿模型的用户交换记录来获取这些数据,而这些转售商是保存此类对话而无需用户知情或同意的代理服务运营商。

Anthropic指出:“在其他情况下,未经授权的实验室将用户的请求重新路由到Claude——在用户不知情或未获许可的情况下——以收集用户与Claude之间的交换数据用于训练。”

自2026年2月以来,该AI公司表示已检测到七起由中国AI实验室进行的非法蒸馏活动,旨在推进其自身模型的发展:

GTG-16005(2026年5月至7月间观察到1.51亿次交换),其中一群阿里巴巴关联运营商针对Claude Opus 4.6和4.7的思维链(CoT)推理记录进行了攻击,这被描述为“我们迄今测量的最大规模蒸馏攻击”。其峰值约为每天300万次交换,由超过3,500个针对代理任务、软件工程、内核开发和长周期任务的欺诈账户发起。

GTG-16002(2026年5月至7月间观察到2300万次交换),其中月之暗面AI暗中将客户请求重新路由到Claude,而不是使用Kimi进行处理,然后向用户展示来自Claude的响应。与此同时,部分这些交换被捕获并保存以训练其CoT模型。据报道,在10天的时间里,月之暗面通过由5,380个欺诈账户组成的代理服务网络(其中大多数位于新加坡和日本)向Anthropic转发了近30万个客户请求。

GTG-16001(2026年7月的14天内观察到超过1210万次交换),其中DeepSeek采取了与月之暗面AI相同的方法,在未经其客户通知的情况下静默转发交换记录到Claude并提取CoT记录。

GTG-16006(在2026年6月和7月的17天内观察到超过340万次交互),其中智谱(又名Z.ai)运行了思维链提取管道,并通过Claude重放Claude的思维轨迹以训练其模型。该活动通过轮换使用273个欺诈账户进行。

GTG-16008(在2026年3月和4月的20天内观察到超过40万次交互),其中小米通过OpenClaw和OpenCode编码工具集,将其自有MiMo模型的用户对话和编程会话重放给Claude,以增强用于未来模型的训练数据。

GTG-16012,其中商汤科技从第三方数据供应商购买了与Claude的用户交互记录。

GTG-16003,其中MiniMax通过一家壳公司建立了自己的代理服务网络,提供访问Anthropic和OpenAI开发的模型,其目的很可能是收集用户与美国前沿模型之间的交互以训练其自身模型。

Anthropic表示:“代理服务的泛滥以规避Anthropic的访问限制,创造了一个二级市场,实验室可以通过该市场购买或以其他方式获取从用户与Claude之间收集的交互数据。”“一些代理服务网络既向不支持地区的用户提供Claude访问权限,还保存交互记录以便将其出售给其他实验室。”

为应对非法蒸馏行为,该公司表示,当用户未能验证其身份时,它会禁止转售账户或来自不支持地区(如中国、伊朗和俄罗斯)的账户。为了增加未经授权实验室蒸馏Claude能力的难度,该模型已更新,在回复前会对其内部思维进行摘要,从而使被盗记录对后续训练的价值降低。

Anthropic补充道:“随着Fable 5.1的推出,我们引入了‘保留思维’功能,它阻止新的API账户更改多轮对话中Claude思维之前的系统提示、工具或消息。”“这些思维是加密的,但在其之前编辑上下文是攻击者常用的一种使Claude泄露这些信息的技术。”

这一进展之际,Anthropic表示已关闭了多个试图利用其模型监视公民并以可能支持生物武器的方式研究疾病的账户。本周早些时候,美国网络安全和情报机构指控中国的人工智能公司通过蒸馏攻击“系统性提取”美国前沿模型的专有功能和能力。

原文链接:https://thehackernews.com/2026/09/anthropic-says-seven-china-based-ai.html
来源:The Hacker News
以上内容由 AI 自动翻译,仅供参考。
← 返回简报