AI Radar先替你读,再把 AI 变化讲明白
EN
AI 规则与来源

Claude 水印刚上线,14.8K 星项目就来拆台:AI 巨头的“赛博烙印”战争开打

最后更新 2026-08-19编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
AI 内容来源标记的三层关系图:文本统计水印、C2PA 文件元数据和可见标记
编辑绘图:文本水印、文件元数据和可见标记不是同一种技术。
一句话结论

watermarks-remover 的爆火证明了用户正在反抗把“AI 参与过”简化成“AI 写的”——但在 Anthropic 官方检测器开放前,没人能诚实证明 Claude 水印已经被清掉。

先说结论

Claude 水印真的一夜变废纸了吗?

先别急。

事情比“又一个 GitHub 神器破解大厂”更热闹:Anthropic 刚把水印推向全球,开源社区马上端出拆台工具;有人退订,有人欢呼“Claude 输了”,Google 同期却在允许用户关闭部分可见水印。最戏剧性的反转是——冲到 14.8K Star 的项目自己都不敢说真的破解了 Claude。

更准确的说法是:Anthropic 刚把机器可识别标记推向全球,一个开源项目在几天内冲上 14.8K Star,公开展示了如何清理隐藏字符、文件元数据,并用重写破坏统计型文本信号。但项目自己的 README 也写得很谨慎:在厂商没有公开检测器和密钥之前,任何工具都不能诚实保证“官方已经检测不到了”。

这不是一场已经分出胜负的破解,而是一次公开压力测试。它把一个更难的问题推到了所有 AI 用户面前:AI 参与过,是否就等于 AI 写的?

Anthropic 刚把锁装上,拆锁的人已经排队

8 月 14 日,Anthropic 发布了 Claude 文本水印的技术说明。它说,未来支持的 Claude 模型会在生成文本时加入不可见的统计信号;支持的文件则会附带签名式 provenance 元数据。Claude 帮助中心进一步说明,标记会覆盖支持模型在 Claude、API、Claude Code、Claude Cowork 等产品中的输出,并在 Claude 提供服务的地区全球应用。

这里有两个时间点不能混为一谈:

  • 欧盟 AI Act 第 50 条相关透明度义务从 2026 年 8 月 2 日开始适用。
  • Anthropic 选择全球部署,是因为目前还没有耐用的按地区切换方案。这是 Anthropic 的产品决定,不是欧盟直接命令全世界的用户统一加水印。

旧模型并不是在同一天全部完成切换。Anthropic 帮助中心写明,8 月 2 日之前推出的模型仍在逐步增加标记支持。因此,“8 月 2 日以后 Claude 的所有回答都有水印”过于绝对。

14.8K 人围观,但项目自己先踩了刹车

watermarks-remover 由 Guillaume Meyer 发起。GitHub API 在 2026 年 8 月 19 日查询到 14,838 Star、1,647 Fork;GitHub 页面显示为约 14.8K Star、1.6K Fork。这个数字说明项目获得了非常快的开发者关注,但不等于它已经通过 Anthropic 官方检测器验证。

项目当前已经不只是一个“删特殊字符”的小脚本,而是一个面向用户自有内容的多层工具:

  • Layer A:清理不可见 Unicode、异常空格、双向控制字符等文本卫生问题。
  • Layer B:通过另一个模型重写文字,试图破坏统计型水印的词语选择分布。
  • 文件层:清理部分 PNG、JPEG、SVG、PDF、DOCX 等容器中的 C2PA、EXIF、XMP 和文档属性。
  • 验证层:项目提供可选的 MarkLLM 等研究工具,用于在同配置的研究检测器上做实验;这不是厂商检测器的替代品。

这也是标题里最容易被偷换的地方:项目“能清理某些可见或可操作的痕迹”,和“Claude 官方检测一定失败”,是两件不同的事。

Claude 到底怎么在一句话里偷偷“盖章”

它不是零宽空格,也不是复制时会消失的特殊字符。

大语言模型每生成一个词,都会在多个合理候选中做选择。比如句子“今天的天气很……”后面可以是“冷”“阴”“凉”,只要不影响意思,选择就有一定自由度。Anthropic 的方案利用的正是这些低风险选择:用只有检测方掌握的密钥改变随机过程,让一段足够长的文字留下可统计识别的轨迹。

这个信号有三个重要特点:

  • 读者看不出来,文本中也不会凭空多出一串隐藏字符。
  • 它不包含具体用户、组织或聊天记录的身份信息。
  • 它证明的只是“Claude 可能参与过”,不是“这篇文章由 Claude 独立创作”。

Anthropic 自己也承认边界:短文本信息量不足时检测效果较弱;事实性很强的句子和代码没有太多自由选词空间,能承载的统计信号更少;如果只是让 Claude 改标点和语法,水印可能弱到无法判断。

第一个反转:重写能破坏信号,也可能毁掉原文

Anthropic 表示,轻微编辑可能不会完全清掉水印,完整重写则可能移除原来的信号。但完整重写同时也改变了原文的词语、声音和细节。到了这一步,它是否还是同一篇由 Claude 生成的文本,本身就变成了一个作者性问题。

watermarks-remover 的 Layer B 因此更像“对抗性改写”或“研究实验”,而不是万能橡皮擦。项目 README 明确提醒:在厂商公开检测器和密钥之前,不能保证处理后的内容无法通过官方检查。

还有一个实际代价:如果为了去掉 Claude 的统计信号,又把文章交给另一个模型完整重写,最终留下的可能不是原稿,也不是可靠的“人类证明”,只是另一段经过 AI 改写的文字。

第二个反转:删掉文件“身份证”,不等于洗掉所有痕迹

这篇话题之所以容易混乱,是因为“水印”经常被用来指三种不同东西:

  1. 文本统计水印:信号藏在模型生成时的词语选择里。
  2. C2PA provenance 元数据:签名信息放在文件的元数据中,记录某个工具参与过生成或处理。
  3. 可见标记:图片、视频或搜索结果里肉眼看到的标签。

C2PA 可以被编辑工具、平台上传流程或格式转换移除;嵌入内容的水印可能在部分变换后仍保留。反过来,删除 C2PA 也不等于清除了内容本身的信号。

OpenAI 的公开说明目前主要讨论受支持的图片和音频来源信号:C2PA 提供上下文,SynthID 直接嵌入媒体内容。OpenAI 也明确提醒,检测到来源信号不等于证明内容准确、未被编辑、合法拥有或由某个具体人创作。The Verge 对 Google 的报道则显示,用户可以关闭部分可见水印,但不可见 SynthID 和 C2PA 仍会保留在支持的媒体中。

所以不能把“OpenAI 的图片/音频来源信号”和“Claude 的文本统计水印”写成同一套已经被统一破解的技术。

更魔幻的是,Google 同一周反向操作

就在 Claude 水印争议发酵的同一周,Google 开始允许 Gemini 和 Flow 用户关闭部分 AI 生成内容上的可见水印。

但这不是 Google 放弃来源追踪。The Verge 报道称,底层不可见的 SynthID 和 C2PA 仍会保留在支持的图片、视频和音乐中。Google 只是把“用户肉眼一定要看到的标记”和“机器仍能检查的来源信号”分开了。

这让几家公司的路线差异突然变得很有戏剧性:

  • Anthropic 把统计信号放进 Claude 选择词语的过程。
  • Google 允许隐藏部分可见标记,但保留不可见水印和来源元数据。
  • OpenAI 当前公开说明主要覆盖支持的图片和音频,并提供相应验证能力。

它们都在回答“怎么证明 AI 参与过”,却没有谁真正解决“AI 参与多少才算 AI 创作”。

有人真退订了,但这还不是“大逃亡”

Business Insider 报道,项目初版大约用了五个小时完成,随后迅速获得 14,000 多个 GitHub Star;该报道还提到,一些用户因为担心水印跟随工作成果而取消 Claude 订阅。另一篇报道采访了四名声称取消订阅的用户,同时写明 Anthropic 表示没有看到整体取消趋势。

这两组信息都不能被夸大成“用户大规模逃离 Claude”。它们更适合被理解为两种信号:

  • 个别专业用户担心客户、学校或公司把“Claude 参与过”误读成“内容完全由 AI 写成”。
  • Anthropic 认为目前没有足够数据证明整体订阅已经受到明显影响。

两边都触及同一个现实:今天的 AI 工作流经常是“人先研究和写作,AI 再翻译、校对、整理或改写”。一个二元标签很难准确描述这种协作。

真正的战争不是水印,而是“谁算作者”

这件事真正值得发布的原因,不是一个去水印项目能不能赢,而是内容来源证明正在从“文件属性”进入“语言生成过程”。

对 Anthropic 来说,水印是透明度和合规工具;对用户来说,水印可能成为客户、平台、学校或审稿流程里的新证据。若使用者把概率信号直接当成作者判决,就会把“AI 参与过”错误翻译成“人类没有创作”。

对 watermarks-remover 来说,14.8K Star 也不是 Claude 已经输掉的证明。它证明了三件更具体的事:用户愿意研究来源标记;统计型标记一旦面对重写就必须接受攻防;开源社区会要求厂商公开验证方法,而不是只接受一句“有水印”。

短期内,最稳妥的做法不是寻找“绝对洗干净”的工具,而是保留自己的工作记录:原始资料、版本历史、人工修改、AI 使用范围和最终审核。来源证明应该帮助解释创作过程,而不是替代创作过程。

真正的大戏还没开场

  • Anthropic 何时开放可供用户和第三方使用的检测 API、密钥和误报说明。
  • 官方检测器对短文本、代码、翻译、校对和长文的阈值分别如何设置。
  • watermarks-remover 的研究基准能否在同配置检测器上稳定复现,而不只是对某一次重写有效。
  • 学校、客户和平台会把“可能由 Claude 参与”解释成什么程度的作者判断。
  • 欧盟透明度义务的执行方式,是否会让不同提供商采用完全不同的标记和检测体验。

常见问题

Claude 现在所有回答都有水印吗?

不能这样绝对表述。Anthropic 说明,支持标记的新模型从发布开始加入水印;8 月 2 日前推出的模型仍在逐步增加支持。具体产品、模型和文件类型也可能不同。

watermarks-remover 真的破解 Claude 水印了吗?

目前不能证明。它可以清理部分隐藏字符和文件元数据,也可以通过重写尝试破坏统计信号;但官方检测器和密钥尚未完整公开,项目自己也将结果描述为 best-effort。

Claude 水印能证明文章是 AI 写的吗?

不能。Anthropic 的原话是判断 Claude 是否可能参与过,不能区分“Claude 写了”与“Claude 大幅编辑了”,也不能证明人类没有参与。

删除 C2PA 就等于删除 AI 水印吗?

不等于。C2PA 是签名元数据,统计水印或 SynthID 类信号可能直接嵌在内容里。删除元数据后,内容本身的信号仍可能存在。

用户现在应该怎么办?

如果内容涉及客户、学校、合规或版权,保留研究材料、版本历史和 AI 使用记录,比寻找一个“去水印按钮”更可靠。不要把检测结果当作作者身份的唯一证据。

证据与原文