8 月 11 日,Anthropic 宣布给 Claude 的所有文本输出打水印。四天后又发了一篇讲原理的博客。
FAQ 里有六条声明,摆在一起看有点像绕口令:
不影响输出质量。读者分辨不出来。文本里没有加任何东西,也没有隐藏字符。不需要额外的 token,不会更贵。而且水印追溯不到具体某个人、某个组织、某次对话。
那水印在哪?
如果不加字符、不加 token、不改质量,一段文字看上去跟没打水印的一模一样,「水印」这两个字还剩下什么含义?
答案挺漂亮的。它没有往文字里塞东西,它改的是模型挑词的那一刻。
水印藏在模型犹豫的地方
先说清楚一个前提:语言模型每写下一个 token(可以理解成一个字或半个词),本质上是在一张概率表上抽签。表上列着所有候选,各自带一个概率。
这条路线的起点是 2023 年 Kirchenbauer 等人的那篇论文,做法很直接:
生成每个 token 之前,拿前面已经写出来的 token 做种子,喂进一个哈希函数,用输出把整个词表随机劈成两半——一半叫「绿名单」,一半叫「红名单」。然后给绿名单里的词加一点分数,让它们更容易被抽中。
检测的时候反过来:拿同一个哈希函数逐个 token 重算,看它当时该属于绿还是红。人写的文字里绿红大概各占一半,模型写的文字里绿的会明显偏多。数一数就知道了。
问题是这个做法有代价:它硬改了模型的输出分布。模型原本想说 A,被偏置推去说了 B。文字质量会掉。学术上管这叫 distortionary——有损的。
Anthropic 这次用的是它的升级版,SynthID-Text,Google DeepMind 2024 年 10 月发在 Nature 上,同月开源,现在躺在 Hugging Face Transformers 里,任何人都能调。核心叫锦标赛采样(tournament sampling):
同样是拿前面若干个 token 做种子。但这次不是把词表劈成两半,而是把候选词编进一张多层对阵表——像一个小型淘汰赛。每一层,密钥给每个候选算一个分数(论文里叫 g-value),分高的晋级。一个词如果能在好几层里连赢,它被抽中的概率就被指数级抬高。
关键在于:这场淘汰赛只在模型本来就拿不定主意的时候才起作用。
如果模型下一个字有 99% 的把握是「的」,那不管淘汰赛怎么打,出来的还是「的」。只有当模型在两个说哪个都对的词之间摇摆——Anthropic 举的例子是 "overcast" 还是 "grey"——密钥的偏好才真正决定了输出。
Anthropic 自己的说法是:影响那些无关紧要的用词选择。

于是那六条声明就全对上了:
| 声明 | 为什么成立 |
|---|---|
| 不加任何字符,没有隐藏字符 | 它没往文本里塞东西,只是在等价选项里换了个挑法 |
| 不需要额外 token,不会更贵 | 词还是那么多个,只是换了几个同义的 |
| 读者分辨不出来 | 被换掉的都是说哪个都行的词 |
| 不影响质量 | 锦标赛采样可以配置成完全不改变输出分布(论文里叫 non-distortionary),这是它比 2023 年那套强的地方 |
| 追溯不到具体某个人 | 密钥是全局的。检测出来的是「这段是 Claude 写的」,不是「这段是谁让 Claude 写的」 |
熵不够,水印就没地方藏
把上面那个前提反过来推,就能解释 Anthropic 自己列出来的三条限制——而且能说明这三条不是工程没做好,是数学上必然的。
Claude 帮助中心的原话是,以下情况可能检测不到:
文本被大幅编辑、改写、翻译,或者掺进了其他文字
段落太短,没有足够的文本形成可靠信号
文件的元数据在格式转换、重新保存、截图等过程中被剥掉了
第三条是另一套机制,等下单独说。前两条的根源是同一个词:熵。
熵在这儿可以理解成「模型有多犹豫」。一段文字里模型犹豫过的地方越多,能藏进去的水印信号就越多;模型越确定,越没地方藏。
于是:
文本太短——犹豫的次数太少,统计上跟碰巧撞上分不开。
改写——你把每个词都换一遍,等于把当初那场淘汰赛的结果全部作废。Anthropic 说轻度编辑大概率去不掉,整篇重写可以去掉,就是这个道理。
代码几乎没有水印。 这条是 Anthropic 自己主动说的:写代码的时候用词自由度太低。变量名叫什么可以随便,但 for 就是 for,return 就是 return,没有等价选项可挑。水印可能只出现在注释里。

至于文件——图片这类——走的是完全另一套东西:C2PA 签名溯源元数据,一个跨行业的内容来源标准。这套的强度跟文本水印不是一回事:截个图就没了。
还得说清楚一件事:Anthropic 的检测 API 还没上线,官方说在做。所以这篇里所有关于水印强弱的说法,来源都是公开论文和 Anthropic 自述,不是实测。
「只有欧盟在管这件事」
Anthropic 说得很明白:打水印是为了合规欧盟 AI Act。
具体是第 50 条第 2 款:提供合成音频、图像、视频或文本的 AI 系统(包括通用大模型)必须让输出带上机器可读的标记。2026 年 8 月 2 日对新上市的系统生效,已经在市场上的宽限到 12 月 2 日。有一条例外:AI 只做辅助性的常规编辑、没有实质改变输入内容及其语义的,不适用。罚则按 AI Act 的条款,最高全球年营收 3% 或 1500 万欧元。
看到这里很容易得出一个结论:这是欧盟一家在给全行业添麻烦。
我原本也是这么想的。查完发现两个地方不对。
中国早了将近一年。 网信办、工信部、公安部、广电总局联合发的《人工智能生成合成内容标识办法》,配套强制性国家标准 GB 45438-2025,2025 年 9 月 1 日就已经施行——比欧盟 AI Act 第 50 条早 11 个月。而且这是强制性国标,不是行业自愿准则。要求分两层:显式标识(界面上看得见的「AI 生成」字样)和隐式标识(写进文件元数据的技术字段)。
技术路线跟欧盟这波不太一样:中国的隐式标识落在文件元数据那一层,更接近 C2PA 的思路,而不是 SynthID 这种改采样的统计水印。(这是我读标准解读文章的理解,标准全文我没通读。)
加州跟欧盟同一天。 美国联邦层面确实没有统一立法——拜登时期的行政令是自愿框架,后来大部分被撤销了,这一点没说错。但加州的 SB 942(California AI Transparency Act)2024 年 9 月就签署了,2025 年 10 月被 AB 853 修订,生效日期挪到了 2026 年 8 月 2 日。
跟欧盟 AI Act 第 50 条同一天。这不是巧合,AB 853 把日期改成这天就是为了对齐欧盟。
SB 942 管的是月活超过一百万的大型生成式 AI 提供方,要求提供免费的检测工具、可见的显式披露,以及嵌进内容里的隐式披露。

所以准确的版本是:美国联邦确实空白,但「其他国家都没有硬性规定」不成立。中国比欧盟早 11 个月,加州跟欧盟同一天。
欧盟推迟了一堆义务,唯独水印一天没推
2025 年 11 月,欧委会提出了 Digital Omnibus——一揽子简化数字法规的方案,明确目的就是减轻合规负担、提升竞争力。2026 年 6 月 16 日欧洲议会通过,6 月 29 日理事会最终放行,7 月 27 日生效。
它把 AI Act 里高风险系统的合规义务往后推了:附件三那些独立的高风险系统(招聘、信贷评分、执法、教育、边检)推到 2027 年 12 月 2 日;附件一那些嵌在医疗器械、机械、车辆里的推到 2028 年 8 月 2 日。主要理由是配套的协调标准还没做出来——按原时间表,企业得在没有基准的情况下证明自己合规。
但注意一个细节:第 50 条不在推迟之列。 透明度义务照常 2026 年 8 月 2 日生效,一天没动。
从时间线上看,欧盟这一轮做的事情是:把那些真正昂贵的、需要建整套合规体系的义务往后挪,同时保住那些便宜的、立刻能见效的透明度要求。
水印属于后者。
还有一个更有意思的信号:Anthropic 是全球统一上水印的,不分区域。 不管你人在布鲁塞尔还是别的地方,Claude 写出来的字都带标记。原因不难猜——按地区分开实现,比统一实现麻烦得多。一个市场的规则,就这么变成了全球默认。
从这个角度看,欧盟的监管影响力其实还在。
欧洲落后这件事,五个因素
我之前写过一篇《AI 时代的全球分层》,把欧洲放在第四档——不是没干,是慢一个数量级。这次查水印,等于从一个很窄的口子又看了同一个问题。
欧洲落后是真的。但监管在里面占几分,我不打算给个数——那需要一个反事实:如果没有这条,欧洲会怎样。没人手里有。下面五条我只摆出来,不排序。
资本规模。 Mistral 是欧洲最大的 AI 公司,2025 年 9 月 Series C 估值 117 亿欧元;2026 年 6 月传闻在谈一轮 30 亿欧元的融资,估值约 200 亿欧元——这条是传闻,没有官宣,我按传闻处理。对照:Anthropic 2026 年 6 月估值 9650 亿美元,OpenAI 2026 年 3 月 8520 亿美元。
资本市场碎片化。 Draghi 报告里那句话说得很准:许多欧洲创新公司最后跑去找美国 VC,因为在美国那个统一大市场里扩张,比啃碎片化的欧盟市场更划算。这是结构问题,不是意愿问题。
能源成本。 Draghi 报告直接指出欧洲企业的能源成本高于美国同行。AI 这行的成本结构里,电是硬约束。
电网接入。 这是那篇分层文章里查出来最扎人的数字:欧洲主要城市的数据中心电网接入,从签合同到通电平均排 7 到 10 年,极端案例 13 年。同一时期 xAI 在田纳西 18 个月拉起了 555,000 颗 GPU。这不是钱的差距,是物理时间的差距。
监管负担。 27 个成员国、多套法规叠加、合规体系要自己搭。这一条真实存在,欧盟自己推 Digital Omnibus 就是承认。
回到水印。它属于最后那条「监管负担」,而且是里面最轻的一档——不损质量、不加 token、不加钱,方法还是 Google 开源的现成实现,接进去就能用。要论证「监管拖垮了欧洲」,它是能找到的最弱的一件证据。
那六条结论都会带水印,其中一条是错的
这篇里的法规部分,我一开始是让 Claude 查的。它给了我六条带链接的结论,读起来很扎实。其中一条是:
加州通过了 AB 3211/SB 942("Digital Content Provenance Standards Act"),要求生成式 AI 厂商从 2025 年 2 月起给合成内容加水印
我去核 AB 3211 的时候什么都没搜到。不是信息少,是它压根没成为法律。
AB 3211(Wicks 提案,California Digital Content Provenance Standards)2024 年 5 月 22 日在加州州众议院三读通过,62 票赞成 0 票反对。然后 8 月 31 日,应 Gonzalez 参议员的要求被列入 inactive file,10 月 2 日正式标记为死在参议院。真正通过的只有 SB 942 一个。日期也不对:不是 2025 年 2 月,是 2026 年 8 月 2 日。
一条结论里两个错。而它恰好是支撑「美国也在管」最直接的那条——我想要这个结论,所以我对它的警惕最低。
现在把这件事放回水印的框架里。那六条都是 Claude 写的。按 8 月 2 日之后的规矩,这样的输出是要带水印的——水印会告诉你它出自模型,一个字都不会告诉你六条里哪条是错的。
Anthropic 自己在帮助中心里写了同样的意思:检测到水印「是一个信号,但不是完全确定的结论」。
写在最后
这件事现在还缺最后一块。8 月 2 日之后,几家主要模型厂商都开始往文本里打水印了,但检测要用密钥,而密钥不公开——在检测 API 上线之前,外面没人能验证它打没打上、打得牢不牢。
Anthropic 说在做。等它出来,我打算拿三段真实的 Claude 输出去测:原样一段、只改几个词的一段、翻译过的一段,看看各自还剩多少信号。那时候才谈得上这套东西管不管用。
信源:Anthropic:How Claude's text watermarking works、Claude 帮助中心:How Claude marks AI-generated content、TechCrunch:Anthropic 水印技术细节、Nature:Scalable watermarking for identifying large language model outputs、google-deepmind/synthid-text、EU AI Act 第 50 条、GB 45438-2025 国家标准全文公开、加州 SB 942 法案原文、加州 AB 3211 立法进程、Digital Omnibus(Gibson Dunn 解读)、Draghi 竞争力报告。文中判断是我自己的看法,不代表任何公司立场。