43 · Claude 文本水印:绿红列表、密钥体系与中文代价

安全 水印 密码学 AI 监管 EU AI Act
Anthropic 产品部署 · KGW (Kirchenbauer et al. 2023) 学术谱系 · EU Code of Practice 合规(2026-08-02 全球生效)

Previous: 2026-08-02 起 Anthropic 为 Claude 公共版文本输出施加不可见水印,覆盖网页 / API / Claude Code / 云平台,无 opt-out。官方只确认特性(不可见、不改变含义、随复制粘贴传播、经受部分编辑),算法细节与检测工具均未发布。

This: 本文把"已知的技术事实"与"研究圈的主流解读"分开解剖:最可能的机制是 KGW 绿红列表统计水印变体(前文 token + 秘密密钥哈希划分绿/红词表 → 采样偏向绿名单 → 检测端重建哈希做统计检验)。同时回答三个被普遍误解的问题:"200 token 阈值"与"2027-02-02 检测互操作"出自 EU Code of Practice,不是 Anthropic;非英语(尤其中文)文本有系统性更高的假阳性代价;"密码提示词拒稿率实验"在公开资料中不存在。

Effect: 官方沉默留下 10 项未解问题(算法参数、密钥体系、误报率指标、中文官方数据、2027 互操作选型……)。对开发者与风险从业者:水印能追溯来源,但挡不住改写与翻译;对中文内容,检测可靠性需打问号。

一、背景:为什么 AI 文本需要"盖章"

2025 年起,深度伪造、AI 文本冒充真人、自动化操纵舆论成为监管焦点。欧盟《人工智能法案》(EU AI Act) 第 50 条落地,配套的 Code of Practice(实施准则)对"AI 生成内容标记"给出了硬性要求:部署方须提供至少两层机器可读标记(元数据 + 水印;纯文本场景可单层豁免),且须提供检测工具。AI 文本水印因此从"研究玩具"变成"合规刚需"。

Anthropic 是第一批在生产环境落地文本水印的实验室:2026-08-02 起,Claude 新模型在网页版、API、Claude Code、Cowork、Tag 以及 AWS / GCP / Foundry 云市场全面输出水印文本,全球生效、无 opt-out。旧模型在 EU 宽限期内(2026-12-02 前)追溯支持。Anthropic 官方对技术的全部描述只有一句"人眼不可见、不改变含义与质量、随复制粘贴传播、可能经受部分编辑"——算法、密钥、检测工具、技术文档,全部未发布。

这是本篇笔记的事实基调:官方确认的信息只有特性描述与生效范围;所有"机制"描述均为研究圈基于水印学术谱系的解读,标注为"推测"。

二、材料地图

材料时间性质
Search Engine Journal 报道:官方公告转述(特性 + 覆盖范围 + 无 opt-out)2026-08官方确认内容的汇总(来源为搜索引擎摘要)
Kirchenbauer et al., A Watermark for Large Language Models(arXiv:2301.10226,KGW)2023-01绿红列表水印的奠基论文——机制解读的学术参照系
arXiv:2604.13776(非英语水印影响实证)2026-04证明非英语文本假阳性率更高、翻译破坏检测
GPTZero CTO Alex Cui 的技术解读(miracleplus 转载)2026-08对 Claude 水印最可能机制的主流解读
EU AI Act Code of Practice(compliancehub 解读)2026200 token 阈值、2027-02-02 互操作期限的真实出处

三、核心机制:绿红列表统计水印(KGW 谱系)

把水印藏进文本,本质是在"让模型自然输出"与"让文本带上可验证的统计指纹"之间做权衡。目前学界最主流的方案是 绿红列表(green/red list)采样,2023 年由 Kirchenbauer、Geiping 等人(KGW)提出,被广泛认为是 Anthropic 方案最可能的谱系。

3.1 生成端:如何把信号藏进采样

模型生成第 t 个 token 时,正常流程是计算候选词概率分布后采样。水印流程多两步:

关键性质:绿红划分逐位置重绘——每生成一个 token,划法都由"该位置前的上下文"重新决定。因此简单的同义词替换、字母大小写改写无法把文本洗回自然分布:改一个词,前后的划分就变了。这正是"经受部分编辑"特性的技术来源。

3.2 检测端:如何把信号捞回来

检测者(持有密钥)拿到待检文本后:

  1. 用相同的哈希规则重建每一位置的绿/红划分——不需要模型,纯统计;
  2. 数出文本中落在绿名单的 token 数量 |s|G;
  3. 与"无水印文本的期望值"比对:随机文本落在绿名单的期望是 50%(γ = 0.5),实际生成的带水印文本会显著高于 50%。
z = ( |s|G − γ|s| ) / √( |s|·γ·(1−γ) )
KGW 检测统计量:绿词数量相对随机期望的超额程度,归一化成标准正态的 z 分数。|s| 为文本 token 数,γ 为绿名单比例,|s|_G 为落在绿名单的 token 数

z 超过阈值(如 4)即判为水印文本。文本越短,统计噪声越大——这就是为什么短文本需要豁免阈值:几十个 token 的文本,绿词比例波动剧烈,误报率不可控。

3.3 为什么是"统计水印"而不是"藏密文"

与把可见标记藏进图片像素不同,文本水印不能靠冗余位——改写一个词就全丢了。绿红列表的巧妙之处在于信号分布在整个词汇选择里:每一处"本可换词但没换"的地方都在投票,攻击者要洗掉信号就得改写足够多的词,而改写越多、文本越走样。这是"不可见"与"鲁棒"的交换点。

⚠️ 数字纪律:KGW 论文里的误报率设定约 3×10⁻⁵(z 阈值 ≈ 4,约 1/33,000)——这是学术论文的设定值,不是 Anthropic 的指标。Anthropic 未公布自己的阈值、偏置强度、绿名单比例任何一项。媒体上出现的"1/100,000"等数字均不可追溯到官方。

四、官方确认 vs 研究圈解读:可信度分层

层内容证据状态
官方确认不可见 · 不改变含义/质量/可读性 · 随复制粘贴传播 · 可能经受部分编辑Anthropic 公告(经媒体转述)
官方确认2026-08-02 起新模型全球生效 · 覆盖 web/API/Claude Code/云平台 · 无 opt-out · 旧模型 12-02 前追溯同上 + EU 宽限期
研究圈解读机制 = KGW 绿红列表变体(哈希切词表 + 偏置采样 + z 检验)GPTZero CTO 等解读,无官方确认
研究圈解读模型级施加(per-model),故跨模型不可比官方只确认"模型级",细节无
外界误传"200 token 阈值"、"2027-02-02 检测互操作期限"出自 EU Code of Practice,非 Anthropic
外界误传"密码提示词被拒的拒稿率实验"公开资料中不存在(多轮中英检索无果)

五、密钥与检测体系:最大的黑箱

统计水印的安全模型取决于密钥管理:

Anthropic 未披露:是否分离、由谁持有、检测 API 是否对外开放。官方检测工具至今未发布——只有公告中承诺的 "forthcoming technical documentation"。这意味着当前阶段第三方无法独立验证任何文本是否带 Claude 水印。

可确定的是监管时间表(EU Code of Practice,非 Anthropic 承诺):2027-02-02 前,签署方须落地"检测互操作"方案,四选一:

  1. 公开检测 API;
  2. 基于路标(signpost)的检测协议;
  3. 加入第三方检测联盟;
  4. 等效方案。

以及水印阈值要求:>200 token 的文本强制可检测水印(超短文本豁免);200–2000 token 区间官方明示"检测可靠性打折";检测工具原则上对监管机构、执法、媒体、事实核查员与研究者永久免费。

六、覆盖范围与阈值

维度状态备注
生效时间2026-08-02(新模型)旧模型 2026-12-02 前(EU 宽限)追溯
表面覆盖网页 · API · Claude Code · Cowork · Tag · AWS · GCP · Foundry全部公共面,无 opt-out
地域全球EU AI Act 驱动但不止于 EU
短文本豁免~200 token 以下出处为 Code of Practice;Anthropic 自身未公布阈值(媒体转述约 100 token,未证实)
检测互操作2027-02-02 前落地API / 路标 / 联盟 / 等效,四选一

七、副作用与局限:中文的代价

7.1 非英语文本:假阳性系统性更高

arXiv:2604.13776(2026-04)是目前最接近"中文副作用"的公开学术依据:非英语母语者生成的文本(尤其tokenization 差异大的语言,如中文)在水印检测下有更高的假阳性率——即"非 AI 文本被误判为 AI 文本"。机理上:非英语的 token 切分粒度不均、可用词汇分布不同,绿红划分的统计假设(均匀 50/50)不再成立。这篇论文同时给出最重的打击:翻译可以把检测降至偶然水平——把英文水印文本翻译成中文再译回,统计信号基本消失。

对中文内容生产者的含义:你的中文 AI 文本可能(a)更容易被误报为 AI;(b)经过任何一次翻译清洗后检测失效。在官方发布中文语言包数据前,这两个风险都只能按学术结论外推,无法精确量化。

7.2 低熵文本:数学、代码、固定格式是水印盲区

学术定论:水印靠"在可选词之间偏置选择"工作。但数学推导、代码、JSON、地址这类低熵文本里,下一 token 几乎唯一确定——没有选择余地,偏置无处施加,信号趋近于零。这让"水印 + 事实性内容"的组合天然两难:越需要精确的文本越难水印。

7.3 攻击面:改写与重组

八、研究圈反应:源头、批评与对照

8.1 思想源头:Scott Aaronson 的 2022 提案

统计水印思想的最早公开源头是 OpenAI 客座研究员 Scott Aaronson(UT Austin,理论计算机科学家)2022 年 10 月的提案:在采样时用哈希划分词表、向特定子集偏置,使模型输出带上可验证的统计签名。KGW 论文将其形式化(绿红列表 + z 检验),Anthropic 的部署被认为是这一谱系的量产化。Aaronson 对 2026 年 Anthropic 部署的公开表态,未找到记录。

8.2 批评声音:Bill Gurley 的"法官、陪审团与检察官"

风投人 Bill Gurley 的批评流传最广:一个模型供应商自己生成、自己检测、自己执法——既当运动员又当裁判,"judge, jury, and prosecutor"。这击中水印生态的核心治理问题:检测密钥由单一厂商垄断,第三方无法独立验证,误判申诉机制缺失。与此对照,Google DeepMind 的 SynthID-Text 是公开披露方案(2000 万条生产交互实证):它也用绿红列表思想,但额外公布了部分实现细节与评估方法——成为"透明水印"的参照物。Anthropic 目前没有任何同等披露。

8.3 安全圈:沉默

截至本次调查(2026-08-12),Matthew Green 等知名密码学/安全学者对 Claude 水印部署无公开评论。社区实践层面,GPTZero 等 AI 检测器对 Claude 文本的判断走的是分类器路线(统计建模),与水印机制无关——市面上没有任何第三方能用"水印"验证 Claude 文本。

九、未解问题清单(官方沉默的十个空格)

#问题为什么重要
1哈希窗口长度(前几 token?)与偏置强度 δ决定鲁棒性与文本质量损失的真实权衡
2采样密钥与检测密钥是否分离决定"检测权"能否安全开放
3检测密钥由谁持有第三方独立验证是否可能
4误报率 / 漏报率的官方指标短文本、非英语场景的风险边界
5中文等多语言官方数据中文用户能否信任检测结果
6绿名单比例 γ(是否 50/50)与 z 检验的统计假设相关
7检测是否在模型层(per-model)还是全局跨模型重写的可检测性
8API 用户是否有 opt-in/out 通道企业合规选型
92027-02-02 互操作将选哪条路径第三方检测生态何时成型
10"经受部分编辑"的官方定义边界改写多少算"部分"

十、对开发者的意义

10.1 三个立即行动

10.2 一个更深的观察

对比 42 号笔记(加密推理块):两家供应商一前一后把"内部机制"放进了黑箱——Claude 加密思考块被证明"只认证内容不认证上下文",Claude 文本水印至今"只确认特性不披露算法"。透明度的缺失并不自动等于不安全的机制(KGW 谱系本身经过了三年学术检验),但它意味着:生态的安全论证,目前只能建立在厂商声明与学术推测上。对风险从业者,这就是教科书级的"密钥垄断 + 不可审计"案例——等待 2027-02-02 的互操作期限,是第一块多米诺。