首頁LBank 新聞中心
Anthropic 正在悄悄為每個 Claude AI 輸出加上浮水印。開發者已經開始嘗試破解它
anthropic-quietly-watermarking-ai-claude-output-builders-break
Anthropic 正在悄悄為每個 Claude AI 輸出加上浮水印。開發者已經開始嘗試破解它
Anthropic 正在將一種看不見、可供機器讀取的浮水印編織進其最新 Claude 模型所寫下的每一個字裡——而且它尚未說明具體方式。
2026-08-13 來源:decrypt.co

簡述

  • 2026年8月2日或之後在歐盟推出的新Claude模型,將在每個生成的文本片段中嵌入機器可讀的浮水印,並在模型層級應用。
  • 這些標記將在全球範圍內的Claude、API、Claude Code和雲端合作夥伴中生效。
  • 移除這些浮水印的開源專案在數日內即已出現。

Anthropic已開始在其最新的Claude模型生成的所有文本中嵌入不可察覺的浮水印。此變更於2026年8月2日在歐盟推出的模型中生效,Anthropic表示此措施將在全球範圍內實施。

Anthropic在簽署歐盟AI法案的透明度行為準則後,在一篇支援文章中闡述了這項計畫。換句話說,這並非完全是自願行為。此標記將涵蓋所有Claude介面,從聊天機器人、API到Claude Code,以及AWS、Google Cloud和Microsoft Foundry等雲端合作夥伴。

Myriad:OpenAI何時會發布GPT-6?點擊以進行您的預測。

Anthropic表示:「當受支援的Claude模型生成文本時,它會將一個不可察覺的浮水印直接編織到文本本身中。您不會看到它,它也不會改變Claude回應的意義、品質或可讀性。」「由於浮水印是文本的一部分,當文本被複製貼上到其他地方時,它也會隨之移動,並且可能在某些編輯後仍然存在。」

因此,這比使用者通常想像的傳統方法要複雜一些。當受支援的Claude模型生成文本時,它會將一個不可察覺的浮水印直接編織到文字中,沒有可見的標籤。由於該標記是文本的一部分,它能承受複製貼上,並且Anthropic承認「可能在某些編輯後仍然存在」。文件還獲得第二層保護:符合C2PA開放標準的簽名元數據(想像一個數位運輸清單,記錄誰製作了文件以及之後是否有人修改過)。

方法保密

Anthropic尚未說明浮水印的製作方式。支援文章稱其為模型層級(模型經過訓練而內建)和文本原生(例如,它不是像元數據生成器那樣的外部工具),但檢測文件和確切技術尚未發布。

研究人員推斷這是一種統計簽名:模型將其詞彙選擇導向一種微弱、可檢測的偏見,這與Google在SynthID Text中使用的S方法屬於同一類。在Anthropic發布檢測器之前,這仍然只是一個猜測。

但這並未阻止隱私權愛好者,一些專家已經在研究破解Anthropic秘密浮水印的方法。mikiane/claude-watermark-cleaner(Github上106顆星)會清除不可見的Unicode,然後使用非Claude模型重寫文本以擾亂詞元模式。

一個更大的專案,guillaumemeyer/watermarks-remover(Github上4.6k顆星),可以去除Claude文本標記以及PNG、JPEG、SVG、PDF和DOCX中的C2PA和SynthID類信號。作者認為,統計文本標記「不是證明來源的可靠方法」,並且主要促使使用者花費第二遍模型處理來清理自己的作品。在Anthropic發布其檢測器和閾值之前,任何移除都無法得到保證。

Anthropic自身的歷史讓隱私權反應更為激烈。今年三月,在研究人員發現其透過未公開的Unicode標記追蹤部分使用者的位置和代理使用情況後,該公司移除了一個隱藏的Claude Code追蹤器——這正是目前浮水印計畫核心的相同靜默標記技術。

這個標記證明了Claude參與了文本,而不是它完全寫下了整個內容,因此它會將經過少量編輯的原始作品與完全由AI生成的文本同等對待。請Claude校對或翻譯您的段落,其輸出仍然可能帶有信號。Anthropic坦承,大量編輯可以去除它,而缺少標記並不表示是人類所寫。

美國的一項法案,COPIED法案,也推動了相同的理念:一種標準化的AI內容浮水印方式,以便平台可以追溯其來源。正如Claude的勒索問題所揭示的,該公司的模型已經因為它們處理的文本而受到嚴格審查。

Anthropic尚未說明何時會發布允許任何人驗證此標記的檢測工具。