
剥离AI隐形指纹:文本Unicode/统计水印+图片文档C2PA元数据,agent skill+本地服务
这是什么
一个 AI 生成内容"痕迹清洁器"(12.8k stars,MIT):agent skill + 纯标准库 Python 本地服务,专门剥离各家大模型在输出里留下的溯源标记(provenance marks)。注意它去的不是图片上看得见的 Logo 水印,而是 AI 厂商藏在内容里的隐形指纹。
三层清除对象
| 层 | 目标 | 方式 |
|---|---|---|
| A 文本层 | 不可见 Unicode、怪异空格、bidi 控制符、tag 字符 | 确定性 Python 脚本,100% 可复现 |
| B 统计层 | token 采样统计水印(Kirchenbauer 式) | Agent 改写 + 可选本地模型 hook,官方明说 best-effort |
| 文件层 | C2PA / EXIF / XMP / 文档属性元数据 | 支持 PNG/JPEG/WebP/BMP/GIF/TIFF/SVG/PDF/DOCX/EPUB/ODT/HTML/MD |
覆盖厂商:Claude、Gemini/SynthID-Text、OpenAI 的溯源表面,以及开源 LLM 的统计水印。
架构亮点
- Skill 是瘦客户端:agent 侧只有 markdown,通过 HTTP 调本地服务(默认
127.0.0.1:8765),agent 宿主机不用装 Python - 服务本体零依赖:Python 3.10+ 纯标准库,
make serve一把起;可选 c2patool / exiftool / qpdf 增强 PDF 处理 - 提供 Grok / Cursor 的 skill 包,
/remove-ai-marks直接调用 - 可选重武器:SynthID 像素评分、CtrlRegen / DiffusionPurification 像素级图像水印去除(吃算力,本地构建)
官方的诚实声明(好评)
文本水印活在措辞本身里,去它=逐句改写,不是段落洗牌能糊弄的;而改写必然压平文风和精确度——"产出不可能超过改写模型的能力上限"。所以 Layer B 从来自称 best-effort,不吹魔法橡皮擦。README 还专门写了伦理页:给自己拥有/授权的内容做隐私清洁,不是拿去学术造假或谎称人工写作。
适合谁
Agent 工作流重度用户:AI 产出的文案/稿子/代码注释要发出去前,过一遍清掉隐藏标记和文件元数据;或者做 AI 检测/反检测研究的。配合 Hermes / Cursor / Grok 这类 agent 食用更佳。
链接
暂无评论
