隨著 Anthropic、OpenAI、Google 等 AI 公司持續探索生成內容的溯源與辨識機制,一款名為 watermarks-remover 的開源工具近期透過 GitHub 發布,試圖從 AI 生成的文字與檔案中移除不同類型的辨識訊號。專案資料顯示,工具的主要定位是隱私保護與研究用途,而非協助使用者將 AI 內容偽裝成完全由真人撰寫。
這項發展也凸顯 AI 內容溯源與反溯源技術之間的競爭正在升溫。當模型開發商逐步導入更難察覺的標記方式,開發者也開始研究如何辨識、拆解或干擾這些訊號。
可處理文字與多種檔案格式
根據專案文件,watermarks-remover 可處理多種可能用於追蹤 AI 生成內容的訊號,包括看不見的 Unicode 字元、統計式浮水印,以及嵌入檔案內的 metadata。
支援的檔案格式涵蓋 PNG、JPEG、SVG、PDF、DOCX、ODT、HTML 與 Markdown。工具也針對常見的來源資訊進行清理,包括 C2PA、EXIF、XMP 及文件屬性等資料。
| 處理類型 | 主要對象 | 處理方式 |
|---|---|---|
| 編輯層面訊號 | 不尋常的 Unicode 字元 | 尋找並移除不可見或特殊字元 |
| 統計式浮水印 | 模型選詞與文字分布 | 改寫句型、用字與轉折,干擾原有統計特徵 |
| 檔案來源資訊 | C2PA、EXIF、XMP 與文件屬性 | 清理檔案 metadata 與相關屬性 |
統計式浮水印比 metadata 更難處理
相較於直接存在檔案內的 metadata,統計式浮水印通常更難移除。這類方法不是在內容外部附加一段明顯標記,而是透過模型生成文字時的選詞方式,讓特定字詞或字詞分布呈現可供辨識的統計特徵。
watermarks-remover 因此採取分層處理方式。除了清理 Unicode 字元與檔案屬性,也會透過改寫文字結構、替換用字及調整轉折,嘗試干擾文字中的統計式浮水印。這代表工具不只是刪除資料,也可能直接改變內容本身。
0.3.1 版本改採更積極的改寫策略
專案最新 0.3.1 版本進一步強化文字改寫功能。相較於只替換少數詞彙,新版本會更積極調整句型、用字與轉折,並提供讓改寫結果更自然的選項。
不過,這種處理方式也增加內容失真的可能性。專案發起人 Guillaume Meyer 坦承,移除統計式浮水印並不能保證成功;改寫過程可能影響原文的語氣、措辭與準確性,當原文需要大幅修改時,影響會更加明顯。
Meyer 進一步指出,一次改寫相當於將高階模型使用的字詞,替換成較低階模型可能採用的字詞,因此也提出疑問:如果使用者先付費採用高階模型,再以較差的模型處理生成內容,這樣做是否會抵銷使用高階模型的價值。
專案強調隱私與研究用途
watermarks-remover 的文件將工具定位在隱私與研究,而不是協助使用者掩飾 AI 生成內容的來源。從技術角度來看,移除 metadata 與不可見字元相對直接;但涉及模型生成分布的統計式浮水印時,工具既無法保證完全清除,也可能犧牲文字品質。
這項限制意味著,工具的使用結果會取決於原始內容、採用的浮水印方法,以及改寫程度。即使內容經過處理,也不能據此推論所有 AI 溯源訊號都已被移除。
AI 溯源與反溯源進入攻防階段
AI 生成內容的辨識與溯源,正逐漸成為模型服務商、平台與內容創作者關注的議題。開源工具 watermarks-remover 的出現,顯示相關技術已不再只是單方面強化標記,而是同時伴隨針對標記的分析與干擾。
未來,AI 浮水印能否在不明顯降低內容品質的情況下維持可靠辨識,以及反溯源工具能否在不破壞原意的前提下移除訊號,將成為這場技術攻防的主要焦點。
Github : https://github.com/guillaumemeyer/watermarks-remover




