本博客日IP超过2000,PV 3000 左右,急需赞助商。
极客时间所有课程通过我的二维码购买后返现24元微信红包,请加博主新的微信号:xttblog2,之前的微信号好友位已满,备注:返现
受密码保护的文章请关注“业余草”公众号,回复关键字“0”获得密码
所有面试题(java、前端、数据库、springboot等)一网打尽,请关注文末小程序
【腾讯云】1核2G5M轻量应用服务器50元首年,高性价比,助您轻松上云
最近有两件事在技术圈里讨论比较火热,一件是《牛来》,一件是《watermarks-remover》。
这个 watermarks-remover 是一款 AI 内容去水印工具,它在 GitHub 上线不到一周就达到约 11k 的 star。
看起来,老外们真的很讨厌水印,看这个火热的项目我有点完全理解他们了。
当 Anthropic 引以为傲的 AI 水印上线后,谁曾想到一位开发者仅用 24 小时就做出了回应。而他的开源项目立马就爆火网络了,成为 GitHub 上最炙手可热的技术仓库之一。所以,接下来我们就一起来看看 watermarks-remover 能爆火的原因是什么?
Anthropic 的一纸水印令
故事要从 2026 年 8 月说起。
Anthropic(Claude 的母公司)突然宣布,为了遵守欧盟《人工智能法案》(AI Act),将在 Claude 生成的所有内容中嵌入隐形水印。
这个隐形水印包括两个层面。
文本层面:通过 token 采样偏置,在生成文本中植入统计性水印。你复制粘贴、甚至大幅改写后,水印依然可能残留;文件层面:Claude 输出的 PNG、JPG、SVG 等文件将携带C2PA 数字签名元数据,相当于给文件盖上一个“AI 出生证明”。
然而这还不是最关键的,最让开发者愤怒的是 Anthropic 没有提供任何关闭选项。无论你是免费用户还是付费订阅者,无论你是否身处欧盟,这个水印都会如影随形。
这相当于是一刀切了,于是网友们瞬间炸锅了。欧盟自己搞出来的监管焦虑,凭什么让全世界几十亿人买单?
就在 Anthropic 高调发布技术博客的第二天,一位名叫 Guillaume Meyer 的开发者(AI 初创公司 Memo 的创始人)在 GitHub 上推出了 watermarks-remover,它是一个旨在“清洗多厂商 AI 溯源标记”的开源工具。
结果 24 小时内,就收获了 2600 颗星。几天后,突破 11000 星。原作者的推文浏览量直逼 200 万。一场关于“创作者主权”的技术反击,就此拉开序幕。
三层清洗架构
watermarks-remover 并非一个简单的“查找替换”脚本。它采用了一套精密的三层防御突破体系,针对不同类型的水印攻击面进行定向清理。
Unicode 文本卫生层
这是最容易理解的一层。AI 模型有时会在输出中嵌入不可见的 Unicode 字符作为标记,例如:
- 零宽空格(Zero-Width Space, U+200B)
- 零宽非连接符(Zero-Width Non-Joiner)
- 双向文本覆盖字符(Bidirectional overrides)
- 标签字符(Tag characters)
- 异体选择符(Variation selectors)
这个 Layer A 第一层通过确定性的 Python 脚本,将这些“隐形墨水”彻底擦除。这一层是可验证、可测试的。用它清理前后,你可以精确统计移除了多少个可疑字符。
统计性水印重写层
这是整个项目的技术深水区,也是对抗 Claude 核心水印机制的关键。
Claude 的水印并非藏在字符里,而是藏在词语选择的概率分布中。模型在生成文本时,会按照一个伪随机规则(基于密钥播种)微妙地偏袒某些 token。这种统计信号不依赖任何可见字符,因此传统的文本清理完全无效。
watermarks-remover 的 Layer B 层采用重写攻击(Rewrite Attack)。
- 通过同义替换、句法重组、连接词变换、句子边界调整等手段,打乱原有的 token 分布模式;
- 支持多种重写强度:从温和的“释义”(paraphrase)到激进的“人性化”(humanize),甚至针对代码的专门模式(保留行为的前提下重命名局部变量、改写注释);
- 提供多候选生成(
--candidates N),通过 bigram Jaccard 距离自动选择词汇差异最大的版本,确保与原文的统计指纹最大程度偏离。
当然,作者坦诚地标注了这一层的局限性,在厂商公布官方检测器和密钥之前,没有任何工具能诚实地保证“通过了官方检测”。Layer B 属于“最大努力”(best-effort)策略,但它采用了学术界公认的标准攻击方法(如回译、释义),在理论上是站得住脚的。
文件元数据剥离层
针对 C2PA、EXIF、XMP、文档属性等文件级溯源标记,项目提供了全面的容器清理能力。
| 格式类型 | 支持格式 | 清理内容 |
|---|---|---|
| 图像 | PNG, JPEG, WebP, BMP, GIF, TIFF, SVG | C2PA manifest、EXIF、XMP、ICC profile |
| 文档 | PDF, DOCX, ODT, EPUB | 文档属性、自定义 XML、嵌入式元数据 |
| 网页/文本 | HTML, Markdown | Generator meta tags、frontmatter AI 标记 |
特别值得一提的是 PDF 的处理,普通的 exiftool 对 PDF 的清理是“增量式”的。原数据字节仍留在文件中,只是被标记为“未引用”。而 watermarks-remover 会进一步调用 qpdf --linearize 对 PDF 进行“结构性重写”,彻底丢弃这些残留数据。这种对细节的执着,体现了作者的安全工程素养。
Thin Client 与工程化思维
如果说三层清洗是项目的“肌肉”,那么它的架构设计则是“骨骼”。
Thin Client 模式
watermarks-remover 的 skill(技能层)是一个“瘦客户端”(thin client)。所有确定性的清洗逻辑都运行在一个独立的 HTTP 服务中(service/scripts/server.py),skill 本身只负责通过 HTTP 调用服务。
这也意味着:
- Agent 主机零依赖:你不需要在运行 AI Agent 的机器上安装 Python、虚拟环境或任何清洗工具;
- 语言无关:任何能发 HTTP 请求的系统都可以集成;
- 统一接口:服务提供
/health、/inspect、/clean、/capabilities等标准端点,并自动生成 OpenAPI 3.0.3 规范文档; - 安全加固:默认仅绑定 localhost,支持 Bearer Token 认证,输入大小限制(默认 256MB),拒绝符号链接攻击,原子写入(temp-file + rename)防止数据损坏。
可选后端插件化
项目将重型计算模块设计为可选外部后端,保持核心轻量:
- CtrlRegen:基于 ControlNet + DINOv2 IP-Adapter 的可控图像再生,用于移除像素域水印(如 SynthID、StegaStamp、Tree-Ring)。默认采用保守强度(0.25),在去除水印和保留原图之间取得平衡;
- MarkLLM:文本水印验证工具,支持 KGW 和 SynthID-Text 方案的检测与验证;
- MarkDiffusion:图像水印验证与 DiffusionPurification 攻击工具。
这种“核心极简 + 插件扩展”的架构,既保证了开箱即用的便利性,又为深度用户预留了专业级能力。
全球开发者的集体共鸣
GitHub 上每天诞生成千上万个项目,为什么 watermarks-remover 能在几天内斩获万星?
说白了,Anthropic 的逻辑隐含了一个危险的前提,只要 AI 参与了一丁点,作品的“纯洁性”就被污染了。
但现实中,很多人花了几十个小时阅读、构思,只是最后让 Claude 润色一下。AI 在这里扮演的角色,本质上和爱因斯坦的助手、达尔文的记录员没有区别。
watermarks-remover 的爆火,是开发者们对“人类必须向工具证明自己才是真正作者”这一逻辑的集体反抗。
Anthropic 发布水印方案的第二天,工具就出来了。一天之内迭代了四个版本。
这种速度传递了一个清晰的信号,任何试图通过技术手段强制实施的单边规则,都将面临同等速度的技术反制。这不是恶意对抗,而是技术生态的自我平衡。
项目 README 中明确写道:
This project is for content you own or are authorized to process.
(本项目仅适用于你拥有或获授权处理的内容。)
它也不鼓励学术造假或虚假声称“人类原创”,而是主张一个基本原则,用户对自己创作的内容享有隐私和卫生权。这种克制的伦理立场,赢得了更广泛社区的支持。
水印攻防战的本质
watermarks-remover 的兴起,揭开了 AI 内容溯源领域的一场深层博弈。
厂商有厂商的困境。
- OpenAI 早在 2023 年就内部测试了文本水印,但调查发现 30% 的用户表示如果 ChatGPT 加水印,就转投竞品,因此迟迟未发布;
- Google 的 Gemini 也开发了类似技术,同样选择按兵不动;
- 只有 Anthropic 选择“先发为敬”,结果成了众矢之的。
这揭示了一个商业现实,水印不是纯粹的技术问题,而是用户信任问题。当水印被视为“赛博烙印”而非“内容凭证”时,它的社会接受度就会崩塌。
另一方面,欧盟的《AI 法案》要求 AI 生成内容必须带有“机器可读标记”,初衷是打击深度伪造和虚假信息。但当执行层面变成“给全球用户无差别打标”时,监管的良好意图就异化为对普通创作者的 surveillance。
更讽刺的是,xAI(马斯克的公司)没有签署欧盟《AI法案》。这意味着 Grok 用户可能不受此类约束。监管的不对称性,反而制造了新的不公平竞争。
欧盟的这招,特别像认真做事的被不做事的立规矩打小报告。
结语
猫鼠游戏的未来应该会存在一段时间的持续对垒,watermarks-remover 的 1.3 万颗星,不是对水印技术的否定,而是对水印强制化的抗议。
文章配图参见公众号:https://mp.weixin.qq.com/s/ej_VhBuVCtNnm1bnYgeRng。
早于它之前的一个兄弟版本,没有出生在好时候呀,star 数远低于 watermarks-remover。
虽说技术本身是中立的。但 C2PA 标准在版权保护、内容溯源领域有重要价值;统计性水印在打击虚假信息方面有其正当性。但当这些技术被包装成“不可关闭、不可选择、不可知会”的默认行为时,它们就从“工具”变成了“枷锁”。
AI 是人类的工具,而非人类的主宰。给 AI 生成的内容加水印,这事不能“大张旗鼓明目张胆”的干。

最后,欢迎关注我的个人微信公众号:业余草(yyucao)!可加作者微信号:xttblog2。备注:“1”,添加博主微信拉你进微信群。备注错误不会同意好友申请。再次感谢您的关注!后续有精彩内容会第一时间发给您!原创文章投稿请发送至532009913@qq.com邮箱。商务合作也可添加作者微信进行联系!
本文原文出处:业余草: » AI 内容去水印工具在 GitHub 上超 12k Star