Previous: 2026-08-02 起 Anthropic 为 Claude 公共版文本输出施加不可见水印,覆盖网页 / API / Claude Code / 云平台,无 opt-out。官方只确认特性(不可见、不改变含义、随复制粘贴传播、经受部分编辑),算法细节与检测工具均未发布。
This: 本文把"已知的技术事实"与"研究圈的主流解读"分开解剖:最可能的机制是 KGW 绿红列表统计水印变体(前文 token + 秘密密钥哈希划分绿/红词表 → 采样偏向绿名单 → 检测端重建哈希做统计检验)。同时回答三个被普遍误解的问题:"200 token 阈值"与"2027-02-02 检测互操作"出自 EU Code of Practice,不是 Anthropic;非英语(尤其中文)文本有系统性更高的假阳性代价;"密码提示词拒稿率实验"在公开资料中不存在。
Effect: 官方沉默留下 10 项未解问题(算法参数、密钥体系、误报率指标、中文官方数据、2027 互操作选型……)。对开发者与风险从业者:水印能追溯来源,但挡不住改写与翻译;对中文内容,检测可靠性需打问号。
2025 年起,深度伪造、AI 文本冒充真人、自动化操纵舆论成为监管焦点。欧盟《人工智能法案》(EU AI Act) 第 50 条落地,配套的 Code of Practice(实施准则)对"AI 生成内容标记"给出了硬性要求:部署方须提供至少两层机器可读标记(元数据 + 水印;纯文本场景可单层豁免),且须提供检测工具。AI 文本水印因此从"研究玩具"变成"合规刚需"。
Anthropic 是第一批在生产环境落地文本水印的实验室:2026-08-02 起,Claude 新模型在网页版、API、Claude Code、Cowork、Tag 以及 AWS / GCP / Foundry 云市场全面输出水印文本,全球生效、无 opt-out。旧模型在 EU 宽限期内(2026-12-02 前)追溯支持。Anthropic 官方对技术的全部描述只有一句"人眼不可见、不改变含义与质量、随复制粘贴传播、可能经受部分编辑"——算法、密钥、检测工具、技术文档,全部未发布。
| 材料 | 时间 | 性质 |
|---|---|---|
| Search Engine Journal 报道:官方公告转述(特性 + 覆盖范围 + 无 opt-out) | 2026-08 | 官方确认内容的汇总(来源为搜索引擎摘要) |
| Kirchenbauer et al., A Watermark for Large Language Models(arXiv:2301.10226,KGW) | 2023-01 | 绿红列表水印的奠基论文——机制解读的学术参照系 |
| arXiv:2604.13776(非英语水印影响实证) | 2026-04 | 证明非英语文本假阳性率更高、翻译破坏检测 |
| GPTZero CTO Alex Cui 的技术解读(miracleplus 转载) | 2026-08 | 对 Claude 水印最可能机制的主流解读 |
| EU AI Act Code of Practice(compliancehub 解读) | 2026 | 200 token 阈值、2027-02-02 互操作期限的真实出处 |
把水印藏进文本,本质是在"让模型自然输出"与"让文本带上可验证的统计指纹"之间做权衡。目前学界最主流的方案是 绿红列表(green/red list)采样,2023 年由 Kirchenbauer、Geiping 等人(KGW)提出,被广泛认为是 Anthropic 方案最可能的谱系。
模型生成第 t 个 token 时,正常流程是计算候选词概率分布后采样。水印流程多两步:
检测者(持有密钥)拿到待检文本后:
z 超过阈值(如 4)即判为水印文本。文本越短,统计噪声越大——这就是为什么短文本需要豁免阈值:几十个 token 的文本,绿词比例波动剧烈,误报率不可控。
与把可见标记藏进图片像素不同,文本水印不能靠冗余位——改写一个词就全丢了。绿红列表的巧妙之处在于信号分布在整个词汇选择里:每一处"本可换词但没换"的地方都在投票,攻击者要洗掉信号就得改写足够多的词,而改写越多、文本越走样。这是"不可见"与"鲁棒"的交换点。
| 层 | 内容 | 证据状态 |
|---|---|---|
| 官方确认 | 不可见 · 不改变含义/质量/可读性 · 随复制粘贴传播 · 可能经受部分编辑 | Anthropic 公告(经媒体转述) |
| 官方确认 | 2026-08-02 起新模型全球生效 · 覆盖 web/API/Claude Code/云平台 · 无 opt-out · 旧模型 12-02 前追溯 | 同上 + EU 宽限期 |
| 研究圈解读 | 机制 = KGW 绿红列表变体(哈希切词表 + 偏置采样 + z 检验) | GPTZero CTO 等解读,无官方确认 |
| 研究圈解读 | 模型级施加(per-model),故跨模型不可比 | 官方只确认"模型级",细节无 |
| 外界误传 | "200 token 阈值"、"2027-02-02 检测互操作期限" | 出自 EU Code of Practice,非 Anthropic |
| 外界误传 | "密码提示词被拒的拒稿率实验" | 公开资料中不存在(多轮中英检索无果) |
统计水印的安全模型取决于密钥管理:
Anthropic 未披露:是否分离、由谁持有、检测 API 是否对外开放。官方检测工具至今未发布——只有公告中承诺的 "forthcoming technical documentation"。这意味着当前阶段第三方无法独立验证任何文本是否带 Claude 水印。
可确定的是监管时间表(EU Code of Practice,非 Anthropic 承诺):2027-02-02 前,签署方须落地"检测互操作"方案,四选一:
以及水印阈值要求:>200 token 的文本强制可检测水印(超短文本豁免);200–2000 token 区间官方明示"检测可靠性打折";检测工具原则上对监管机构、执法、媒体、事实核查员与研究者永久免费。
| 维度 | 状态 | 备注 |
|---|---|---|
| 生效时间 | 2026-08-02(新模型) | 旧模型 2026-12-02 前(EU 宽限)追溯 |
| 表面覆盖 | 网页 · API · Claude Code · Cowork · Tag · AWS · GCP · Foundry | 全部公共面,无 opt-out |
| 地域 | 全球 | EU AI Act 驱动但不止于 EU |
| 短文本豁免 | ~200 token 以下 | 出处为 Code of Practice;Anthropic 自身未公布阈值(媒体转述约 100 token,未证实) |
| 检测互操作 | 2027-02-02 前落地 | API / 路标 / 联盟 / 等效,四选一 |
arXiv:2604.13776(2026-04)是目前最接近"中文副作用"的公开学术依据:非英语母语者生成的文本(尤其tokenization 差异大的语言,如中文)在水印检测下有更高的假阳性率——即"非 AI 文本被误判为 AI 文本"。机理上:非英语的 token 切分粒度不均、可用词汇分布不同,绿红划分的统计假设(均匀 50/50)不再成立。这篇论文同时给出最重的打击:翻译可以把检测降至偶然水平——把英文水印文本翻译成中文再译回,统计信号基本消失。
学术定论:水印靠"在可选词之间偏置选择"工作。但数学推导、代码、JSON、地址这类低熵文本里,下一 token 几乎唯一确定——没有选择余地,偏置无处施加,信号趋近于零。这让"水印 + 事实性内容"的组合天然两难:越需要精确的文本越难水印。
统计水印思想的最早公开源头是 OpenAI 客座研究员 Scott Aaronson(UT Austin,理论计算机科学家)2022 年 10 月的提案:在采样时用哈希划分词表、向特定子集偏置,使模型输出带上可验证的统计签名。KGW 论文将其形式化(绿红列表 + z 检验),Anthropic 的部署被认为是这一谱系的量产化。Aaronson 对 2026 年 Anthropic 部署的公开表态,未找到记录。
风投人 Bill Gurley 的批评流传最广:一个模型供应商自己生成、自己检测、自己执法——既当运动员又当裁判,"judge, jury, and prosecutor"。这击中水印生态的核心治理问题:检测密钥由单一厂商垄断,第三方无法独立验证,误判申诉机制缺失。与此对照,Google DeepMind 的 SynthID-Text 是公开披露方案(2000 万条生产交互实证):它也用绿红列表思想,但额外公布了部分实现细节与评估方法——成为"透明水印"的参照物。Anthropic 目前没有任何同等披露。
截至本次调查(2026-08-12),Matthew Green 等知名密码学/安全学者对 Claude 水印部署无公开评论。社区实践层面,GPTZero 等 AI 检测器对 Claude 文本的判断走的是分类器路线(统计建模),与水印机制无关——市面上没有任何第三方能用"水印"验证 Claude 文本。
| # | 问题 | 为什么重要 |
|---|---|---|
| 1 | 哈希窗口长度(前几 token?)与偏置强度 δ | 决定鲁棒性与文本质量损失的真实权衡 |
| 2 | 采样密钥与检测密钥是否分离 | 决定"检测权"能否安全开放 |
| 3 | 检测密钥由谁持有 | 第三方独立验证是否可能 |
| 4 | 误报率 / 漏报率的官方指标 | 短文本、非英语场景的风险边界 |
| 5 | 中文等多语言官方数据 | 中文用户能否信任检测结果 |
| 6 | 绿名单比例 γ(是否 50/50) | 与 z 检验的统计假设相关 |
| 7 | 检测是否在模型层(per-model)还是全局 | 跨模型重写的可检测性 |
| 8 | API 用户是否有 opt-in/out 通道 | 企业合规选型 |
| 9 | 2027-02-02 互操作将选哪条路径 | 第三方检测生态何时成型 |
| 10 | "经受部分编辑"的官方定义边界 | 改写多少算"部分" |
对比 42 号笔记(加密推理块):两家供应商一前一后把"内部机制"放进了黑箱——Claude 加密思考块被证明"只认证内容不认证上下文",Claude 文本水印至今"只确认特性不披露算法"。透明度的缺失并不自动等于不安全的机制(KGW 谱系本身经过了三年学术检验),但它意味着:生态的安全论证,目前只能建立在厂商声明与学术推测上。对风险从业者,这就是教科书级的"密钥垄断 + 不可审计"案例——等待 2027-02-02 的互操作期限,是第一块多米诺。