未来的 Claude 模型生成的文本将包含水印——一种微妙的模式,让任何拥有正确密钥的人都能检查 Claude 是否可能参与了某段文本的生成。Anthropic 与其他几家主要 AI 提供商一起正在实施这一变更,以遵守要求标记 AI 生成内容的《欧盟人工智能法案》。
水印方法会影响 Claude 在生成过程中的词汇选择,特别是在多个词汇选择能产生大致相同含义的情况下。例如,在短语”今天的天气很冷,而且”中,模型可能同样选择”阴沉”或”灰蒙蒙”。当水印处于激活状态时,这些同样有效的选项之间的选择遵循的是源自加密密钥的模式,而非任意随机——但从读者的角度来看,它完全保持随机性。
该方法借鉴了 Google DeepMind 于 2024 年在《自然》杂志上发表的 SynthID-Text 技术,该技术本身建立在研究员 Scott Aaronson 早期的提案之上。一个有用的类比将其比作决定棋盘游戏走法:无论你掷骰子还是查阅圆周率数字,对玩家来说结果都同样感觉随机,但圆周率的序列如果你知道要寻找它,会留下可检测的痕迹。Claude 的水印文本以相同的方式工作——读者体验到相同的质量和意义,但分析师可以评估词汇选择是否符合 Claude 的水印模式。
内部测试和 Google 自己的实验发现,水印文本和非水印文本在输出质量、创造力或可读性方面没有可测量的差异。人工评估者逐项比较响应时无法区分它们。水印不增加标记,对速度的影响可以忽略不计,且不携带有关特定用户、组织或对话的信息——它无法被追踪到个人。
该系统存在固有的局限性。在有严格事实要求的段落中——比如用”4″完成”2 + 2 =”或将牛顿的著作命名为”Principia Mathematica”——水印无法产生有意义的影响。短文本提供的词汇决策较少,使得检测可靠性降低。Claude 仅进行小幅编辑的校对任务可能留下不足的水印痕迹。代码通常需要精确术语,与散文相比往往接受较轻的水印处理,尽管注释和任意命名选择仍然携带该模式。
图像输出将使用不同的机制:Claude 将附加 C2PA 元数据凭证——文件头中的加密签名笔记——以表明 AI 的参与。这个开放的行业标准也被相机制造商和照片编辑软件使用,允许任何支持 C2PA 的工具验证凭证而不改变图像本身。
Anthropic 计划发布水印检测 API。该公司指出,第三方 AI 检测服务的工作方式不同——它们分析风格模式(如措辞倾向),而不是检查加密水印模式。水印只能确认 Claude 可能参与;它不建立所有权,不改变服务条款下的用户权利,也不区分 Claude 编写的文本与 Claude 大量编辑的文本。