8月14日,Anthropic 发布技术说明称,未来的 Claude 模型生成文本将带有可检测的水印。该公司表示,此举旨在帮助判断一段文字是否可能有 Claude 参与生成,同时配合欧盟《AI 法案》有关标记 AI 生成内容的要求。

Anthropic 采用的是一种基于词语选择概率的文本水印思路。模型在语义相近的候选表达之间作出选择时,会利用密钥形成可供后续核验的统计模式;普通读者无法凭阅读直接区分有无水印。该公司称,这种做法不增加隐藏字符或额外文本,也不应对内容质量、可读性、生成速度和服务价格带来实际影响。

水印不会附带用户、组织或具体对话的识别信息,也不会增加额外 token 成本。Anthropic 强调,检测结果只能反映 Claude 可能在内容生成或处理过程中参与过,并不能据此断定作者身份、所有权或法律责任;短文本、严格事实表述、轻度校对和代码等场景的可检测信号也可能较弱。

根据公告,Anthropic 将在上线时全球实施该机制,原因是暂时没有可靠的方法按地区划分部署范围。公司还计划推出水印检测 API,具体实现细节仍在制定中。对于 Claude 生成的部分图像文件,官方称会采用 C2PA 内容凭证记录生成或处理来源,这与文本水印属于不同技术路径。

这意味着 AI 内容溯源正在从平台规则走向产品侧能力。水印能提供概率性线索,但不等同于通用的“AI 写作鉴定”;它的有效性仍取决于文本长度、后续编辑程度以及不同服务商之间的检测兼容性。

来源:Anthropic 于2026年8月14日发布的《How Claude’s text watermarking works》。本文为中文编译与整理。