Jason Anthropic Watermark Era
水印时代:当 Anthropic 决定在你写的每一行 AI 文字上打上永久印记
2026 年 8 月 2 日,欧盟《人工智能法案》Article 50 透明度条款正式生效。同一天,Anthropic 在所有新发布的 Claude 模型中默默启用了文本水印。9 天后的 8 月 11 日,一份更新的支持文档把这件事公之于众:从今往后,所有 Claude 生成的文字将自动携带一个你看不见的水印。你可以复制它、粘贴它、嵌入邮件或论文,标记会跟着走。全球适用,无一例外,不可关闭。
这不是一个功能发布。这是一次关于谁将定义”AI 内容”的权力宣告。而这场宣告背后,是法规、商业利益、技术标准与创作自由之间一场已经开始的持久冲突。
法规的触发器:8 月 2 日
理解这个决定,必须先理解那个触发它的时间点。
欧盟《人工智能法案》Article 50 透明度条款在 2026 年 8 月 2 日正式生效。条款要求 AI 提供者以”机器可读的方式”标记 AI 生成或编辑的内容——这不是建议,不是最佳实践,而是法律强制性要求,违反者面临全球年营收 4% 的罚款。欧盟委员会同日发布了配套的执法说明,确认 AI 办公室将与各国当局联合执法。
Anthropic 的响应不是”9 天后才部署”——而是从法规生效当天起就在新模型中启用了水印,8 月 11 日只是正式通过支持文档向公众说明。覆盖范围:API、Claude 平台、Claude Code、Claude Cowork、Claude Tag——所有产品,一个也不漏。
但有一个细节值得仔细审视:Anthropic 选择了全球适用,而不仅仅是欧盟范围。
EU AI Act 的 Article 50 约束的是”向欧盟市场提供 AI 系统的提供者”——对于非欧盟用户的服务,法律并不直接要求标记。技术上,Anthropic 完全可以分区域合规,为欧盟用户部署水印,为其他地区维持原有体验。他们没有这样做。全球统一部署是一个主动的、超出法规要求的选择。
Euronews 的标题一语中的:“EU compliance, delivered globally.”
学术原理:水印是怎么藏进文字里的
要理解这个政策的技术边界和局限性,得先理解文本水印的学术根基。
核心论文:Kirchenbauer et al. (2023)
当前文本水印技术的学术基础来自马里兰大学 John Kirchenbauer 等人 2023 年发表的论文 “A Watermark for Large Language Models”(arXiv:2301.10226,后发表于 ICML 2023)。
其核心机制优雅而简洁:在模型生成每一个 token 之前,系统根据前一个 token(或前 n 个 token)和一个密钥,将词表中的所有候选 token 分为两组——“绿色列表”(green list)和“红色列表”(red list)。然后在采样时,轻微提升绿色列表 token 的被选概率。
单个 token 级别的偏移极其微小,对文本质量几乎无影响。但当文本足够长时,绿色 token 的统计富集变得高度显著——检测者只需知道密钥,就能通过统计检验判断一段文字是否携带水印。
关键特性:
- 文本可读性不受影响(人类无法感知差异)
- 需要约 200-800 个 token 才能可靠检测(取决于误报率设定)
- 不修改模型权重,只修改采样过程
- 密钥持有者可以验证,非持有者无法检测
Kirchenbauer 团队在后续论文 “On the Reliability of Watermarks for Large Language Models”(2023,arXiv:2306.04634)中进一步验证:即使经历人工改写(paraphrasing),水印仍可检测——因为改写者在统计上倾向于保留原文的 n-gram 片段。观察足够多的 token 后,水印证据会累积到可检测阈值。
后续演进:从 green-list 到工业部署
学术界在 2023-2026 年间快速推进了这个方向:
Distortion-free 方法:2024-2025 年出现了一批”无畸变”水印方案(如 DAWA 算法,arXiv:2410.02890),能在不改变模型输出分布的前提下嵌入可检测信号——理论上对文本质量零影响。
Google SynthID-Text:Google DeepMind 的 “Scalable watermarking for identifying large language model outputs”(2024)将水印从学术原型推向工业级部署,在标准 benchmark 和人类评估中均未发现能力退化。
多比特水印:从单纯的”有/无”二元检测,演进到可编码多比特信息(如模型版本、生成时间、用户 ID 等),为溯源提供更丰富的元数据。
Anthropic 没有公开其具体实现细节,但支持文档的描述——”模型层级实施”、”不影响可读性”、”专用检测系统可识别”——高度一致于 green-list 类方案的工程实现。
$50 攻破:水印的学术脆弱性
然而,学术界同时也在系统性地攻击水印。
2024 年,ETH Zurich 的 Nikola Jovanović、Robin Staab 和 Martin Vechev 发表了 “Watermark Stealing in Large Language Models”(arXiv:2402.19361,ICML 2024 接收)。他们展示了一个令人不安的结果:花费不到 $50 的 API 调用费用,就能逆向工程出水印的密钥规则,然后以超过 80% 的成功率同时实现两件事——从带水印文本中清除水印(scrub),以及在无水印文本中伪造水印(spoof)。
这篇论文的核心洞察是:如果检测系统通过公开 API 可查询(即使只是”是/否”的二元反馈),攻击者就可以通过系统性探测逐步推断出绿色列表的构成规则。
这意味着 Anthropic 面临一个设计选择的困境:
- 公开检测 API→ 便于生态合作伙伴验证,但给攻击者提供了逆向工程的窗口
- 保持检测闭源→ 安全性更高,但违背了开放透明的精神,且把”认证权”垄断在自己手中
截至目前,Anthropic 选择了后者——尚未公开检测规范或 API。Implicator.ai 指出:”Anthropic has released no specification anyone outside the company can test.”这是一个值得持续关注的权力不对称。
技术机制:Anthropic 的具体实现
回到 Anthropic 的产品实现层面。
文字水印:嵌入在文本序列的统计特征中——通过在词序列的概率分布中引入可检测的特征模式,在不改变文本可读性的前提下植入标记。普通阅读无法察觉,但专用检测系统可以识别。
文件水印:使用 C2PA(内容来源与真实性联盟)开放标准,在文件元数据中签入来源信息。C2PA 已被 Adobe、BBC、Google、Microsoft、OpenAI 等机构采纳,是业界在内容真实性领域最具共识的开放标准。
鲁棒性边界(根据 Anthropic 官方说明及独立验证):
- 复制粘贴:水印完整保留
- 轻度编辑(修改个别词句):水印在很多情况下仍然存在
- 格式转换(如纯文本→Markdown):水印存活
- 重度改写或翻译(实质性语义重构):水印可能失效
- 截图(对于文件):文件元数据丢失,C2PA 标记随之消失
这意味着文本水印不是无法绕过的技术锁。ETH Zurich 的研究从学术层面证明了系统性绕过的可行性;而在实践中,任何充分的人工改写都足以清除痕迹。
但这正是设计的边界所在:水印的目标不是防止蓄意规避,而是在无意或低意图的内容流通场景中标记溯源,以及为合规审计提供证据链。 对于后者,水印已经足够。对于前者,它只是一道象征性的栏杆。
社区反弹的真实逻辑
消息发布后,X 和 Reddit 上迅速出现大规模抗议。用户们把这个政策描述为”hugely problematic”,宣告”可否认 AI 写作时代的终结”。
情绪化反应背后,批评者提出了几个值得认真对待的论点:
一刀切的道德等同。 这个政策把两类截然不同的使用者放在同一个标签下:用 AI 批量生成虚假信息的内容农场主,和用 Claude 校对自己邮件语法的职场人。水印不区分目的、不区分使用量、不区分人工参与深度。EU AI Act 的立法意图是识别危险,实际执行变成了全面普查,中间的差距由写作者承担。
创作者身份的稀释。 “我用 Claude 校对了几个句子,这篇文章是不是 AI 写的?”水印存在意味着”有 AI 参与”,但参与程度的差异——从单个词的建议到完整生成——在标记上无法区分。出版商、学术机构、雇主可能根据水印存在与否做出评判,而不管人工参与的实际深度。
技术依赖的暴露。 使用 Claude API 构建产品的企业,其产品输出现在自动携带了”Anthropic 制造”的技术标识。在商业竞争层面暴露技术栈选型,在监管层面可能触发额外审查。许多企业选择 Claude 是因为输出质量,但不一定希望终端用户或竞争者知道这一点。
监管外溢。 水印一旦部署,其使用不限于合规目的。政府可以筛查文件中的 AI 痕迹;雇主可以扫描工作报告;学校可以检测作业。水印创造的是通用检测基础设施,其应用场景远超原始立法意图。一旦检测系统存在,它的使用者不会只局限于最初的设计目的。
这些担忧不是妄想症,而是对技术基础设施功能演化规律的正常预判。
水印经济学:谁承担成本,谁获得收益
任何政策决定都有成本收益的分配结构。
成本承担者:首先是普通用户和内容创作者——他们失去了使用 AI 工具的”可否认性”。对于在严格反 AI 环境中工作的人(学术、新闻、某些出版商),水印可能实质性改变工具选择。其次是 API 企业客户——他们无意中成了 Anthropic 技术选型的展示橱窗,没有选择权。
收益获得者:监管机构得到了超预期的执行力度(全球适用而非欧盟限定)。内容平台获得了标准化的 AI 内容过滤基础设施。Anthropic 自己获得了”第一个合规者”的身份和标准制定参与权。AI 行业整体获得了一个相对温和的技术解决方案,避免了更激进的监管干预(如要求人工审核或强制披露使用者身份)。
分配结构的本质:成本主要由个人用户承担,收益主要由机构和平台获取。这是监管驱动下技术决策中的常见模式——理解这个结构,比单纯讨论水印好坏更有价值。
Anthropic 的战略判断:为什么做得比法规要求更多
那么 Anthropic 为什么选择”全球适用、无退出”这个超出法规最低要求的强姿态?
监管预期管理。 EU AI Act 只是第一个全面的 AI 透明度法规。美国、英国、加拿大、澳大利亚都有类似政策动向。与其未来面临分散的区域合规要求维护多套系统,不如一次性建立全球单一标准。Anthropic 押注透明度法规是全球不可逆趋势——成为第一个全球部署者,比分市场合规更有长期价值。
公众信任的主动储蓄。 2026 年 FLI AI Safety Index 刚刚发布——没有任何主要实验室的安全评分超过 C+,排名第一的 Anthropic 也只有 2.66/4.0。在这个背景下,主动超越合规要求的透明度行动是信任资本的储蓄。这个决定牺牲了部分用户即时满意度,换取”我们在法律要求之外主动选择透明”的清晰叙事。
C2PA 标准的生态卡位。 Anthropic 是 C2PA 联盟参与者,通过率先在文本领域大规模部署,帮助这个标准从图像扩展到文字——如果 C2PA 成为未来内容真实性的全球基础设施,早期深度参与者将在标准演化中拥有更大话语权。选择开放标准(而非自研专有格式)意味着放弃独占检测能力,换取标准的普及速度和生态广度。在内容真实性领域,生态效应远比专有技术更重要。
跟随者的不同步伐
根据 EU AI Act 透明度实践守则,已承诺遵守的公司包括 Black Forest Labs、Google、Meta、Microsoft、OpenAI 和 Synthesia。但承诺和部署之间存在显著差距。
在文本水印的产品级全球部署上,Anthropic 是目前明确宣布并执行的首家主要 AI 模型公司。OpenAI 的 DALL-E 有 C2PA 图像水印,但文本领域的部署计划尚未明确。Google DeepMind 有 SynthID-Text 的学术研究,但产品端全面部署的时间表未公布。
同一时期,AI 音乐平台 Suno 在 8 月 6 日宣布将为生成音乐加水印(面临多起版权诉讼压力下的防御性举措)。此前 7 月,Substack 已与 Pangram 合作推出 AI 内容识别工具。各个内容生产环节的水印系统正在逐步就位。
整体趋势不可逆转:内容真实性基础设施正在从”可选功能”演变为”强制基础设施”。Anthropic 的决定是这个演变中一个重要的加速节点。
从行业博弈角度看:率先合规者承担用户反弹的直接成本,但获得先发叙事优势;跟随者可以观察反弹模式、等待合适时机,但可能失去”主动透明”的品牌加分。
第三层洞察:谁真正拥有”AI 内容”的定义权
这场水印争论的更深层意义,不在于技术可行性,也不在于合规成本,而在于一个更根本的权力问题:谁有权定义什么是”AI 内容”?
当 Anthropic 的水印系统说”这段文字有 AI 参与”,这个判断是由模型层级的统计标记做出的——不是由写这段文字的人,不是由读这段文字的人,而是由生成这段文字的系统本身。AI 系统成为了其自身内容真实性的认证机构。
更值得注意的权力不对称:Anthropic 决定水印如何工作,Anthropic 控制检测方法(目前未公开任何外部可测试的检测规范),Anthropic 定义”可识别性”的技术标准。即使在遵守 EU AI Act 的框架下,实际技术标准的制定权仍然在私营公司手中。
ETH Zurich 的研究进一步加剧了这种不对称——如果 Anthropic 公开检测 API,攻击者可以 $50 成本逆向工程并清除水印;如果保持闭源,则只有 Anthropic 能认证什么”是”和什么”不是”AI 内容。两条路都有代价,而 Anthropic 选择了把认证权留在自己手中。
EU AI Act 要求”机器可读的标记方式”,但没有规定具体技术标准——这个空间留给了 C2PA 等行业联盟,而联盟的核心成员正是被监管的科技巨头。监管者设定目标,执行技术的定义权属于被监管者。这是数字基础设施监管中反复出现的结构性矛盾。
还有第二个权力维度:Anthropic 通过全球统一部署,实际上为所有欧盟以外的用户做出了一个法规并不强制要求他们接受的决定。这是私人公司将跨国法规的效力延伸到管辖范围之外的行为——不管意图如何,效果是在代替全球用户做出了合规选择。
中国 AI 公司的镜鉴
对于百度、阿里、字节跳动等在欧洲有业务布局的中国 AI 公司,Anthropic 的先例值得关注。如果 EU AI Act 透明度条款成为全球 AI 内容监管的事实参考标准,进入欧洲市场将面临同等合规要求。
与此同时,中国本土的 AI 内容监管(如 WAIC 2026 推进的治理框架)可能与欧盟的 C2PA 路径走向不同技术标准。内容真实性认证领域可能形成全球分裂格局——正如互联网时代的 DNS 和防火墙分裂一样,AI 时代的内容认证基础设施也可能走向区域化。这为在两个体系间运营的企业增加了显著的合规复杂度。
结语
今天,Anthropic 打出了第一个全球性的文本水印。它标注的不只是 Claude 生成的文字,也标注了 AI 公司与内容世界关系的一次历史性转变:从生产工具,到认证机构,再到内容基础设施的建设者。
用户的反弹是真实的,担忧是合理的。但退一步看,反弹的规模本身说明了一个更深的事实:AI 辅助写作已经渗透到足够多的日常工作流中,以至于”水印会影响我的内容”变成了一个切实的个人问题。这种渗透的广度,恰恰是透明度法规存在的理由。
学术研究告诉我们,水印在技术上既不是不可攻破的($50 可以逆向工程),也不是毫无价值的(800 token 后统计证据累积到可靠检测)。它的价值不在于绝对安全性,而在于大规模内容流通中的统计可追踪性——这足以支撑合规审计和平台治理,即使无法阻止蓄意规避。
监管者、平台、创作者、AI 公司——他们在这个议题上的利益不完全对齐,但都被同一个水印体系所连接。理解这个体系如何运作、理解谁有权定义其中的规则,是下一个十年内容生态最重要的治理问题之一。
水印时代已经开始。没有退出选项——就像水印本身一样。
参考资料
-
Anthropic 官方支持文档 — “How Claude marks AI-generated content”(2026-08-11) https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
-
TechCrunch — “Anthropic says it will watermark text generated by its AI models”(2026-08-11) https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
-
Forbes — “Claude Will Put Invisible Watermarks On AI Text And Images—And The Internet Isn’t Happy”(2026-08-11) https://www.forbes.com/sites/maryroeloffs/2026/08/11/claude-will-put-invisible-watermarks-on-ai-text-and-images-and-the-internet-isnt-happy/
-
Euronews — “EU compliance, delivered globally: Anthropic to watermark Claude’s output worldwide”(2026-08-11) https://www.euronews.com/next/2026/08/11/eu-compliance-delivered-globally-anthropic-to-watermark-claudes-output-worldwide
-
Implicator.ai — “Anthropic Watermarks Claude Text Worldwide Under EU Rules”(2026-08-11) https://www.implicator.ai/anthropic-eu-watermarking-claude-worldwide/
-
EU AI Act Article 50 官方指引 — “Guidelines on transparency obligations”(2026-08-02) https://digital-strategy.ec.europa.eu/en/policies/guidelines-ai-transparency-obligations
-
EU 透明度实践守则 — “Code of Practice on Transparency of AI-generated Content” https://digital-strategy.ec.europa.eu/en/policies/code-practice-ai-generated-content
-
Kirchenbauer et al. — “A Watermark for Large Language Models”(2023, ICML) https://arxiv.org/abs/2301.10226
-
Kirchenbauer et al. — “On the Reliability of Watermarks for Large Language Models”(2023) https://arxiv.org/abs/2306.04634
-
Jovanović, Staab, Vechev (ETH Zurich) — “Watermark Stealing in Large Language Models”(2024, ICML) https://arxiv.org/abs/2402.19361
-
Google DeepMind — “Scalable watermarking for identifying large language model outputs”(2024) https://www.researchgate.net/publication/385176946
-
FLI AI Safety Index Summer 2026 — Future of Life Institute(2026-07-07) https://futureoflife.org/wp-content/uploads/2026/07/AI-Safety-Index-Summer-2026-Digital-14-Jul.pdf
-
TechCrunch — “Amid legal battles, Suno says it will start watermarking songs”(2026-08-06) https://techcrunch.com/2026/08/06/amid-legal-battles-suno-says-it-will-start-watermarking-songs/
-
ProofreaderPro — “Anthropic’s Claude Watermark, Explained”(2026-08-11) https://proofreaderpro.ai/blog/claude-watermark-explained
本文写于 2026 年 8 月 12 日。Anthropic 水印政策自 8 月 2 日起在新模型中生效,8 月 10-11 日通过支持文档正式公开。文中”Claudefishing”为行业讨论中出现的新造词,非正式术语。ETH Zurich 的水印攻击研究针对的是通用 green-list 类水印方案,Anthropic 的具体实现细节未公开,其抗攻击能力尚无独立第三方验证。本文不构成投资建议。