
前些天 A 社宣布要给模型生成的文本加水印。
8 月 14 日,它家发文来解释了工作原理:
Claude 模型生成的文本将会内置水印。借助水印,可以判断一份文本有多大可能性由 Claude 参与创作。为遵守欧盟《人工智能法案》,我们与其他多家主流 AI 服务商都在落地这项改动。
在本文中,我们将解答大家关心的各类问题:这套水印技术如何运作、是否会影响 Claude 输出质量,以及推行该功能的原因。核心要点总结:
Claude 这类大语言模型,是逐词生成文本的。每一步选择下一个词时,模型会在一批候选词汇里挑选,结合前文选出最通顺合理的词。 举个例子,句子:“今天天气很冷,而且……”。下一个词几乎不会选“甜的”,更可能是“阴天”或者“灰蒙蒙的”。多数情况下,读者不会在意二选一选哪一个,整句话语义基本不变。遇到这种二选一无所谓的场景,模型原本依靠随机数做最终取舍。
文本水印,正是利用文本中大量这类无关紧要的选词机会,在输出内容里埋入一套特征模式。这套模式人类肉眼无法察觉,但持有对应密钥的工具就能够检测出来。
开启水印后,词汇依旧是随机选出,只是随机数的来源发生了改变。不再调用普通随机生成器选词;水印机制会结合密钥与前面的部分上下文,来决定模型最终选哪个词。 也就是说 Claude 选出的词依旧具备随机性;但人们可以核查整段文字的词汇序列,判断它是否符合该密钥下 Claude 的选词逻辑。如果匹配,就可以算出这份文本由 Claude 生成的概率。
重点:水印并不会让模型刻意偏向某一个词。和无水印版本一样,这一句选“阴天”,下一句就可能选“灰蒙蒙的”,完全取决于上下文。水印也不会逼迫模型选用它原本不会使用的生僻词,不会强行让 Claude 去选用诸如“阴翳”这类日常几乎不会出现的晦涩同义词。
水印不会降低输出质量。对于阅读者,带水印和不带水印的输出没有任何区别。 这和纸币、实体物件、部分文档里肉眼可见的传统水印完全不一样。
我们内部测试没有观察到水印对文本内容、创意水平、可读性带来负面影响。我们使用的这套技术源自谷歌 DeepMind 的 SynthID‑Text 论文:当时谷歌在部分 Gemini 流量上部署水印版本,对比用户点赞、点踩反馈,水印版与普通版不存在统计学层面的显著差异。在对照实验中,人工评审者并排阅读两份输出,也分辨不出质量差别。
可以用大富翁游戏做通俗类比:每回合玩家掷骰子获得随机点数前进。假设我们不用掷骰子,改用圆周率π的数字序列来提供随机数。从π小数点后某一位数字(例如第 1012845 位,数值为 6)开始,后续每一步直接依次取用π的数字当作“掷骰结果”。
对玩家来说,移动效果依旧是随机的;无论是掷骰子,还是读取π数字,都不会改变游戏体验与结局。但是游戏结束后,如果拿到全部行动记录,并且知道取用的是π序列,就可以判断这场游戏是否是用这套规则生成的。某种意义上,这场游戏就带上了“水印”。
Claude 生成文本同理:水印不会改变读者阅读体验。但事后如果需要核验文本是否大概率出自 Claude,水印就可以发挥作用。
Claude 文本水印是谷歌 DeepMind2024 年发表在《自然》期刊的** SynthID‑Text 技术的改良版本**。该技术流派最早可以追溯到 Scott Aaronson2022 年提出的构想,核心设计逻辑完全一致:水印只改变选词环节的随机源。
水印检测本身存在局限性:使用我们的密钥,仅能回答“这份文本有多大概率部分由 Claude 撰写”。 它不能证明文本是人类写的;也无法区分是不是别的 AI 生成——其他 AI 即便有水印,密钥各不相同,甚至使用完全不一样的水印算法。
短文本样本检测效果很差,可供分析的选词样本太少,信息不足。文本篇幅越长,判定 Claude 参与的置信度就越高。
在事实类文本中,可供自由选词的空间很小,一旦选错就会破坏事实准确性,水印可嵌入的机会就会变少。 例如句子:“艾萨克·牛顿最知名著作名为《原理》……”,下一个词几乎只能是“数学”,没有备选,水印在这里就无法生效。 校对润色场景同理:如果只修改语法标点,改动量极少,水印几乎没有可以附着的空间。
水印只会作用于 Claude 自己选择输出的词语。 当 Claude 校对人类原稿时,大多只做少量修改;绝大部分文字依旧属于人类,水印能够附着的内容非常有限甚至完全没有。 最终能不能检出 Claude 参与,取决于原文长度以及 Claude 修改幅度。Claude 改写、创作的内容越多,可供水印嵌入的空间就越大。
前面提到,AI 水印依赖多个等价可行的候选词。如果输出要求高度精确,选错就会出错、代码直接报错,这种位置不会施加水印扰动。
举例子:模型输出完“2 + 2 =”,下一个 token 唯一正确答案就是“4”,不存在等价备选项,水印不会在这里干预。同理,绝大多数代码必须精准运行,相比普通自然文本,代码整体携带的水印特征会弱很多。
当然,代码内部的注释、变量命名存在自由选择空间的地方,依旧会带上水印;但不会对代码实际运行逻辑造成实质影响。
不会。水印对模型推理速度几乎无影响,不会产生额外 token,调用、使用的成本保持不变。
不能。水印标记的是 Claude 的输出,完全不携带任何用户相关信息。水印本身、配套密钥都无法还原出用户身份、所属机构、对话记录。
推行水印是为了遵守欧盟《人工智能法案》。 Anthropic 与其余主流 AI 厂商,合计约 190 家签署方,于 2026 年 7 月签署《AI 生成内容透明度欧盟行为准则》,准则要求 AI 服务商对 AI 生成文本实施标记。
上线初期我们选择全球统一开启水印,因为目前还没有成熟可靠的方案做到仅针对特定地区启用。后续我们会持续评估其他方案,有进展将对外更新。
我们很快会上线水印检测 API,相关实现细节还在敲定中。
当 Claude 生成 PNG、JPG、SVG 这类支持格式的文件时,会在文件元数据嵌入一条经过密码学签名的内容凭证,标注这份文件由 Claude 生成或处理。 这套是行业开放标准 C2PA,相机厂商、图片编辑软件也在用该标准记录图片来源,支持 C2PA 的工具都可以读取凭证。我们后续也会上线工具,支持上传文件核验。
⚠️ 该元数据凭证和文本水印不是一回事。文件本体不会改动,没有嵌入隐形水印。和文本水印一样,凭证仅说明 Claude 参与处理,不包含任何个人身份信息。
一定程度上可以。轻微改写一般不会彻底抹除水印;但逐句大幅度重写替换全部词汇,水印就会失效。当然经过彻底重写之后,这份文本是否还能算作 AI 生成内容本身也存在争议。
水印仅能够证明:Claude 很可能在某个环节参与过这份内容的创作。无法区分是“Claude 完整写的全文”还是“Claude 做了重度改写编辑”。
会。翻译的每一个词汇都是 Claude 生成选择,因此翻译结果带有水印。
欧盟法案针对 2026‑08‑02 之前发布的 Anthropic 模型设置了过渡期。我们也会为旧模型增加水印,会在未来数月逐步完成部署。
普通 AI 检测软件拿不到我们的水印密钥,依靠完全不同的原理。这类工具分析文本语言特征,捕捉 AI 写作常见语言习惯;例如 AI 很爱用“这不是 A,而是 B”句式,高频使用“悄然”这类词。靠文本写作特征识别,和密钥校验水印,底层逻辑完全不一样。
不会。水印只用于判断内容是否由 Claude 生成/处理。水印本身不定义著作权、作者身份,不会改动服务协议赋予用户的各项权利。水印只会在 Claude 确实参与内容生成处理时生效。
脚注
上一篇:最近大火的 AI 岗位,FDE 到底是干嘛的?普通人怎么上车?
下一篇:没有了