Anthropic 正在構建 AI 產業中最全面的生成文本溯源方案之一。2026 年 9 月 9 日,該公司將**不可見文字水印(text watermark)**回溯套用至 Claude Opus 5——這是首個接收此技術處理的既有模型。而在 8 月 2 日之後發布的所有新模型(包括 Fable 5.1、Mythos 5.1),則從上市首日即內建水印。
技術原理:SynthID-Text
Claude 的文字水印採用 Google DeepMind 於 2024 年發表在《自然》期刊的 SynthID-Text 方法。其核心原理為:
- 語言模型在生成每個 token 時,會從一個候選詞彙表中選取。在多數情況下,多個候選詞的語意差異微乎其微(如「多雲」與「陰天」之間的選擇)
- 水印技術利用此類低風險選擇,在生成的文本中留下一個統計模式
- 該模式對讀者完全不可見,但持有金鑰者可以檢測
Anthropic 強調水印不影響輸出品質、不增加 token 成本、不包含個人識別資訊,也無法追溯至特定使用者或對話。
部署範圍與時間線
| 階段 | 日期 | 範圍 |
|---|---|---|
| 強制生效 | 2026 年 8 月 2 日 | 所有新模型(Fable 5.1、Mythos 5.1)內建水印 |
| 回溯套用 | 2026 年 9 月 9 日 | Claude Opus 5(7 月發布)開始接收水印 |
| 持續推出 | 未來數週 | 其他既有 Claude 模型陸續覆蓋 |
Anthropic 正在開發一個 檢測 API,目前處於私人預覽階段,僅供監管機構、記者和研究人員使用。這意味著短期內一般開發者尚無法自行驗證文本是否由 Claude 生成。
EU AI Act 合規背景
Anthropic 與約 190 個簽署方一道,於 2026 年 7 月簽署了 EU AI Code of Practice on Transparency of AI-Generated Content。該規範要求 AI 服務提供者採用標記方法標示 AI 生成內容。Anthropic 選擇全球範圍部署而非僅限歐盟市場,因為目前尚無可靠的區域限定方式。
C2PA 內容憑證
除了文字水印,Claude 生成的可支援檔案類型(如 .png、.jpg、.svg)將附加 C2PA Content Credentials——一組嵌入檔案元數據的加密簽名,標示該檔案由 Claude 建立或處理。使用者無需修改程式碼或請求處理方式即可獲得此標記。
產業意義
1. AI 內容溯源從介面層移至模型層
不同於以往依賴 ChatGPT 等介面附加免責聲明的方式,Anthropic 的水印部署將溯源能力內建於模型權重本身。這是 EU AI Act 第 50 條的核心要求,也代表了 AI 內容監管從「告知」走向「技術強制」的關鍵轉變。
2. 檢測能力的不對稱
水印技術本身是開放的(基於已發表的學術方法),但檢測金鑰僅由 Anthropic 控制。這創造了一個不對稱的局面:模型可以生成帶水印的文本,但只有特定機構能驗證。Anthropic 計畫逐步開放檢測 API,但目前的節制步伐引發了學術界與記者團體對透明性不足的擔憂。
3. 對亞洲市場的影響
對於香港與亞洲的 AI 開發者與內容創作者而言,這項部署具有兩層意義:
- 採用 Claude 進行內容生成的企業,其輸出的可溯源性將自動增強,有助於應對未來可能出現的 AI 內容揭露法規
- 然而,水印的檢測 API 目前僅限歐盟監管機構與特定研究人員,亞洲用戶短期內無法自行驗證 Claude 輸出,形成監管工具上的落差
4. 法律與實務邊界
Anthropic 明確指出,水印僅能判斷 Claude 是否可能參與了內容的生成,無法區分「Claude 完全撰寫」與「Claude 大幅編輯」的差別。水印也不改變輸出內容的所有權或法律責任歸屬——使用者仍對其使用 Claude 產生的內容負全部責任。
展望
隨著其他主要 AI 提供者(如 OpenAI、Google DeepMind)預計也將推出類似的水印方案,內容溯源正在快速從自願措施轉變為行業標準。對於研究 AI 治理的學者與政策制定者而言,文字水印的技術選擇、檢測權限的分配、以及跨司法管轄區的合規策略,將成為下一階段 AI 監管討論的核心議題。
本文信息來源:Anthropic 官方部落格(How Claude’s Text Watermark Works)、Nature 期刊(SynthID-Text 論文)、EU AI Code of Practice 官方頁面、Anthropic Claude Fable 5.1 系統卡。