← 返回 2026-09-13 简报

Anthropic称,七家中国AI实验室实施了工业级Claude蒸馏攻击

语音播报
摘要
事件:Anthropic披露七家中国AI实验室实施工业级Claude蒸馏攻击,包括阿里、深度求索等,利用虚假账号窃取数据训练模型。 要点:阿里集群发起超1.51亿次对话攻击;月之暗面通过代理重定向近30万请求;智谱旋转273个账号提取推理链。 影响:迫使Anthropic更新Claude以加密推理过程并封禁未验证账户,加剧了AI数据获取与模型安全防御的技术对抗。

Ravie Lakshmanan 2026年9月11日 人工智能 / 网络犯罪

Anthropic周四表示,它发现并中断了针对Claude的、来自七家位于中国的实验室的大规模非法知识蒸馏攻击,其中包括阿里巴巴、月之暗面(Moonshot)、DeepSeek、Z.ai(即智谱)和MiniMax。

知识蒸馏本身是一种合法的训练方法。它指的是一种机器学习技术,其中大型、强大的AI模型扮演“教师”的角色,以训练较小、能力较弱或速度更快的“学生”模型来复制其能力。

另一方面,非法知识蒸馏是一项大规模行动,它在未经授权的情况下秘密提取模型的能力并将其复制到另一个模型中,通常是通过利用由被盗信用卡、登录凭证和API密钥创建的虚假账户网络来实现的。

包括Google和OpenAI在内的西方前沿AI实验室曾多次指出针对其模型的知识蒸馏攻击。Anthropic表示,它观察到未经授权的实验室采用“日益复杂的方法”来绕过防御并窃取其能力,例如通过提示操纵技巧获取代理能力、工具使用、编码与数据分析以及逻辑推理能力。

Anthropic称:“DeepSeek、小米和月之暗面将其自身模型与用户之间的对话输入到Claude中。这些实验室随后利用Claude的响应作为训练数据,以蒸馏Claude的能力。其中一些交换内容包含敏感信息,包括来自个人用户、大型跨国公司和政府关联实体的信息。”

这家AI公司表示,这些实验室通常通过代理服务器(也称为中转或中继站)路由请求来获取对其模型的访问权限,这些代理服务器利用虚构身份、虚假或被盗的信用卡以及非法获取的属于合法公司或个人的API密钥创建数千个新账户。

据Anthropic称,未经授权的AI实验室还通过从第三方转售商处购买的方式,获取用户与美国前沿模型之间交换内容的转录文本,而这些转售商是保存此类对话而未获用户知情或同意的代理服务器运营商。

Anthropic指出:“在其他情况下,未经授权的实验室将用户的请求重定向到Claude——未经这些用户的知情或许可——以收集用户与Claude之间的交互内容用于训练。”

自2026年2月以来,该AI公司表示已检测到七起由中国AI实验室发起的非法知识蒸馏活动,旨在推进其自身模型的发展:

GTG-16005(2026年5月至7月期间观察到1.51亿次交互),其中一群与阿里巴巴相关的运营商针对Claude Opus 4.6和4.7的思维链(CoT)推理转录内容进行了攻击,这被描述为“我们迄今测量的最大规模知识蒸馏攻击”。其峰值约为每天300万次交互,由超过3,500个欺诈账户发起,目标包括代理任务、软件工程、内核开发以及长周期任务。

GTG-16002(2026年5月至7月期间观察到2300万次交互),其中月之暗面(Moonshot AI)暗中将客户请求重定向至Claude,而非使用Kimi进行处理,随后向用户展示来自Claude的响应。与此同时,部分这些交互被捕获并保存,用于训练其CoT模型。据报道,在10天的时间里,月之暗面通过由5,380个欺诈账户组成的代理服务器网络,将近30万个客户请求中继给Anthropic,其中大部分账户位于新加坡和日本。

GTG-16001(2026年7月期间14天内观察到超过1210万次交互),其中DeepSeek采取了与月之暗面相同的方法,在未经其客户知情的情況下静默中继交互内容至Claude并提取CoT转录文本。

GTG-16006(在2026年6月和7月的17天内观察到超过340万次交互),其中智谱(又名Z.ai)运行了思维链提取管道,并通过Claude重放Claude的思维轨迹以训练其模型。该活动通过轮换使用273个欺诈账户进行。

GTG-16008(在2026年3月和4月的20天内观察到超过40万次交互),其中小米通过OpenClaw和OpenCode编程工具包,将其自身MiMo模型的用户对话和编程会话重放给Claude,以增强用于未来模型训练的数据。

GTG-16012,其中商汤科技从第三方数据供应商处购买了用户与Claude的交互记录。

GTG-16003,其中MiniMax通过一家壳公司建立了自己的代理服务网络,提供访问Anthropic和OpenAI开发的模型,其目的很可能是收集用户与美国前沿模型之间的交互以训练其自身模型。

Anthropic表示:“代理服务的泛滥以规避Anthropic的访问限制,创造了一个二级市场,实验室可以通过该市场购买或以其他方式获取 harvested 的用户与Claude之间的交互数据。”“一些代理服务网络既向不支持地区的用户提供Claude访问权限,还保存交互记录以便出售给其他实验室。”

为应对非法蒸馏行为,该公司表示,当用户未能验证其身份时,会禁止转售账户或来自不支持地区(如中国、伊朗和俄罗斯)的账户。为了增加未经授权实验室蒸馏Claude能力的难度,该模型已更新,在响应前总结其内部思维过程,从而使被盗记录对后续训练的价值降低。

Anthropic补充道:“随着Fable 5.1的推出,我们引入了‘保留思维’功能,该功能阻止新的API账户更改多轮对话中Claude思维之前的系统提示、工具或消息。”“这些思维是加密的,但在其之前编辑上下文是攻击者用来诱使Claude泄露思维的常见技术。”

这一进展之际,Anthropic表示已关闭了多个试图利用其模型监视公民并以可能支持生物武器的方式研究疾病的账户。本周早些时候,美国网络安全和情报机构指控中国的人工智能公司通过蒸馏攻击“系统性提取”美国前沿模型的专有功能和能力。

原文链接:https://thehackernews.com/2026/09/anthropic-says-seven-china-based-ai.html
来源:The Hacker News
以上内容由 AI 自动翻译,仅供参考。
← 返回简报