ClaudeCode锁住的水印,终于被人撬开了。

admin 2026-08-21 05:23:55 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: Anthropic为Claude产品添加了统计型文本水印,引发开发者对AI内容溯源标记的担忧。开源项目watermarks-remover在短时间内获得大量关注,它可处理EXIF、C2PA、隐藏字符等元数据,但对基于统计规律的文本水印只能通过改写内容来干扰,无法保证完全去除。文章指出AI水印与C2PA数字身份证不同,并认为生成与检测之间的技术攻防战才刚刚开始。 综合评分: 75 文章分类: AI安全,安全工具,技术标准,实战经验,其他


Claude Code 锁住的水印,终于被人撬开了。

原创

开源日记 开源日记

开源日记

2026年8月19日 14:21 湖北

在小说阅读器读本章

去阅读

最近去AI水印的工具,一夜之间全部扎堆冒出来了。

源头是Anthropic这步棋:给Claude所有的产品都加上了隐形水印,你关不掉。

有人不乐意了,网上吵成一片。

我注意到大家讨论最多的是一个叫 watermarks-remover的项目。

在短短几天内就获得了1.4万次的Star。

它本来只是一款处理AI内容溯源信息的工具,但是最近几天特别出圈。

事情是这样的。

8月上旬,Anthropic给部分Claude模型加上了机器可以识别的内容标记。

也就是说以后用Claude Code写代码、写Markdown、写文档,里面的内容可能会有看不出来的身份信息。

这也意味着,AI 水印已经从图片走进了我们每天写的代码和文本。

有人好好奇了 Claude 的水印,到底藏在哪里?

我一开始也以为,所谓水印就是在文本里面塞几个特殊字符。

后来仔细看了Anthropic的说明,发现其实并不像表面那么简单,文本水印主要是通过生成过程中的统计规律来实现的。

模型在生成文本的时候,会遇到一些意思相近、概率也相近的词。

比如这里可以选grey,也可以选overcast,水印机制在低风险的选择上会留下一定的模式。

单独看一句话是发现不了的,但是当文本足够长的时候,这些选择就会形成机器可以检测到的统计特征。

因此它不是在文字中藏一个“水印字符”,而是在大量的词语选择中慢慢形成一种看不清的指纹。

为什么 Claude Code 让这件事情突然变大?

以前大家谈论AI水印的时候,更多的会想到图片。

但是Claude Code是不一样的,我平时可以让它写 Shell、Python、SQL、Java,甚至直接修改整个项目。

那么问题就出现了:如果代码也带有机器可以识别的标记,那么以后提交代码、编写技术文档的时候,是不是也会留下 AI 参与过的痕迹呢?

Anthropic 也说明过,在代码场景中不会直接修改代码语法,而只对适合做统计标记的文本进行处理。

但是开发者真正担忧的是,以后 AI 辅助开发会越来越普遍,代码来源也会成为新的身份标签。

那问题来了,这些看不见的标记到底能不能去掉?

回过来我们聊一下这个去水印的项目。

watermarks-remover 并不是只对图片进行处理,它是把各种类型的 AI 溯源信息都放在一起。

目前公开介绍中,它可以处理隐藏的Unicode字符、C2PA、EXIF、XMP以及部分文档元数据。

对于统计型文本水印,它就用改写内容的方法来试图干扰原来的数据规律,但并没有保证百分之百去除。

它处理的其实不是一种水印。

我研究了一下这个项目后发现,发现所谓的AI水印其实有好几种不同的东西。

第一种是EXIF、XMP、C2PA等文件信息,它们更像是一种附加在文件上的数字简历。

第二种就是零宽字符、方向控制符等一些看不见的字符,虽然在文本编码中存在,但是人眼无法看到。

第三种是Claude这样的统计型文本水印,它不是藏在一个字符里面,而是藏在大量的词的选择规律之中。

第四种就是把图片的内容直接嵌入到不可见的信号中去,这样处理起来就比删除元数据要复杂得多。

这时候,就不得不提到一个经常被讨论的标准:C2PA。

C2PA 实际上就是一张数字身份证。

除了Claude的文本水印之外,我认为C2PA也应当单独提出来。

它更像是一张数字身份证,可以记录文件来源、创建工具、操作历史和数字签名等信息。

一张图片里可以同时包含像素内容、EXIF、XMP和一份C2PA Manifest。

因此C2PA和Claude的文本水印不是同一个东西,前者是文件来源证明,后者是内容本身可以被机器识别的标记。

OpenAI 也正在使用 C2PA 和 SynthID,并且提供了一个公开的验证工具来检查部分生成内容的来源信号。

真正麻烦的,是这些标记你根本看不见。

我觉得这类项目最有意思的地方,就是很多东西你自己根本看不到。

复制一段 Claude 生成的文字,粘贴到记事本里,看起来和普通文字没有区别。

但是如果检测器掌握了相应的方法和密钥的话,它就可以试着在很长的文本中去发现其中的统计规律。

这就让我想到了以前的隐写术,表面看起来是普通的内容,但是真正的信息却隐藏在肉眼看不见的地方。

那这个项目到底能不能全部去掉 ?

答案是不能这么简单理解。

如果是EXIF、XMP、C2PA或者隐藏字符等,清理起来比较容易,因为它们本身就是文件中独立的信息。

但统计型水印就完全不同了,项目通常需要通过重写文本来破坏原来的统计模式。

随之而来的就是文本重写之后,原来的表现形式、语气和技术含义都可能发生改变。

因此我更愿意把它看作是AI内容清理和研究的工具,而不是把它当作一个可以保证内容“绝对不被发现”的工具。

想试的话,装起来很简单。

打开Claude Code输入:

帮我安装 https://github.com/guillaumemeyer/watermarks-remover/tree/main/skills

然后就可以直接调用了。

/remove-ai-marks 你的内容。

另外该项目还提供了web api服务,有兴趣的朋友可以跑起来试一下。

写在最后

Anthropic 在生成阶段加入了标记,目的是让 AI 内容更易被识别。

开源社区也一直在研究这些标记,哪些能被检测出来,哪些又能被清除。

一边是生成,一边是检测,再到清理和验证,慢慢就变成了一场新的技术攻防。

我觉得现在才刚刚开始,Anthropic 还会提供专门的检测功能。

后续其它的AI厂商大概率也会有类似的行动。

毕竟大家已经被AI生成的内容弄得够呛了,后面肯定要找方法来识别和清理。

有需要的朋友可以装上试试看。

开源地址:https://github.com/guillaumemeyer/watermarks-remover

平时我会持续地分享一些有趣的开源项目,有兴趣的朋友可以关注一下。

可以回复关键词聊天,找你想要的项目。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:开源日记 开源日记 开源日记《Claude Code 锁住的水印,终于被人撬开了。》

评论:0   参与:  0