Anthropic 的 AI 浮水印到底有沒有用?技術面的真相
AI 浮水印:Anthropic 的善意,還是一場精心設計的 PR
> Nerf Watch
先說結論:Anthropic 推出的 AI 內容浮水印,我認為是一個效果被高估、目的被美化的功能。技術上有結構性限制,商業上有明顯的合規動機,真正保護到的是 Anthropic 自己,不是你。
這件事是怎麼發生的
故事的起點很簡單:歐盟的 AI Act 上路了。
EU AI Act 對「高風險」AI 系統的透明度要求很嚴格,其中一條就是 AI 生成的內容必須要有某種形式的標記或揭露。Anthropic 作為一家在歐洲有業務的 AI 公司,合規壓力是真實的。於是他們宣佈了 watermarking 機制 — 針對 Claude 生成的文字加入隱形浮水印,讓偵測工具可以識別這段文字是否由 AI 產生。
聽起來很合理。但 Ben Thompson 在 Stratechery 的分析讓我對這個功能的實際效果打了一個大問號。
他的核心論點是:這個功能比官方說的差很多,而且差的方式,是技術層面的根本限制,不是工程問題。
技術面的問題:浮水印是怎麼運作的,又為什麼容易失效
要理解為什麼 AI 文字浮水印不可靠,先要知道它大概怎麼做的。
目前主流的 LLM 文字浮水印,是在 token 採樣階段動手腳 — 簡單說,模型在決定「下一個詞是什麼」的時候,會在機率分佈上做一些有規律的調整,讓某些特定的 token 組合被更頻繁地選中。這個規律本身是一個 secret key,理論上只有知道這個 key 的偵測系統才能驗證。
這個方法在學術上叫做「statistical watermarking」,最著名的是 Maryland 大學 John Kirchenbauer 等人在 2023 年提出的方法。核心概念是把 token 分成「green list」和「red list」,watermarked 的文字會系統性地偏向 green list,統計上就能被偵測出來。
但問題來了:
第一,對短文字無效。 這個統計方法需要足夠長的文字才能有顯著的 signal。根據原始論文的估計,可靠偵測大概需要 200 token 以上。你叫 Claude 寫一句話、寫一段說明、寫個 email 標題?水印基本沒用。
第二,稍微改一下就掉了。 這是最致命的問題。水印是統計特性,不是加密簽名。你把 AI 生成的文字複製貼上,然後改掉 20% 的詞,統計模式就可能被破壞了。更別說 paraphrase attack — 你叫另一個 LLM 把這段文字改寫一遍,水印幾乎必死。
第三,語言品質有代價。 為了讓水印更明顯(更容易偵測),你需要讓 green list 的偏移更強,但這代表模型的輸出品質會下降,因為有些「最好的詞」可能在 red list 裡。這是一個 tradeoff,而且兩邊都不完美。
這讓我想到 DRM(數位版權管理)走過的路。音樂產業在 2000 年代初花了巨大的力氣推 DRM,每一種保護機制最後都在幾週內被破解。最終的結論是:對付真正想繞過的人,DRM 沒用;對付普通用戶,DRM 只是製造麻煩。AI 浮水印目前的處境感覺很像。
商業面的問題:這對誰有利
站在商業邏輯的角度看,這個功能的受益者比較清楚。
Anthropic 有 EU AI Act 的合規壓力。推出 watermarking,不管效果好不好,至少在監管層面交代得過去。這讓我想到大企業在面對新法規時的標準操作 — 先做一個「符合精神」的東西,然後等監管細節更明確再說。
目前沒有公開數據說明有多少比例的 Claude 用戶真的需要這個功能,也沒有說明偵測準確率在真實場景下是多少。Anthropic 的官方說法側重在「我們有做」,而不是「我們的準確率是 X%」。這個資訊不對稱本身就值得注意。
對企業客戶來說,這個功能的 value proposition 更像是一個 checkbox — 「我們使用的 AI 服務有 watermarking 機制」這句話放在內部報告裡比較好看,至於機制是否真的有效,大部分人不會深究。
從投資者的角度看,我不認為這個功能對 Anthropic 的估值有任何實質影響。Anthropic 上一輪融資後估值據報導約 615 億美元(來源:多家財經媒體報導,2025 年),他們的核心護城河是模型能力和企業客戶,不是合規工具。watermarking 頂多是個防禦性動作,讓他們在歐洲市場的監管風險降一點。
Meta 判讀:這是 Nerf Watch
定級:Nerf Watch
AI 浮水印這個方向,正在被技術現實削弱。
不是說這個技術方向完全沒有未來 — 如果浮水印機制被整合進更底層的基礎設施(例如 content provenance 標準,像 C2PA 那樣在 metadata 層做記錄),效果會比純文字統計水印強很多。C2PA(Coalition for Content Provenance and Authenticity)是目前比較有希望的方向,Adobe、Microsoft、Intel 等都在推,概念是在內容生成的源頭就打上可驗證的 cryptographic 簽名。
但純文字的 statistical watermarking,在目前的技術限制下,更像是一個「讓人感覺有做事」的功能,而不是真正能在對抗場景下可靠運作的防偽手段。
這個 Nerf 的影響範圍不只是 Anthropic,整個 AI 內容偵測產業都受影響。市面上賣「AI 內容偵測器」的產品,準確率本來就很不穩定 — GPTZero 等工具的 false positive 率一直被學術界批評。再加上 watermarking 本身的技術限制,整個「AI 內容偵測」的市場定位都有點尷尬。
我的建議
如果你是工程師或產品開發者:
不要把 Anthropic 的 watermarking 當作一個可靠的 content authenticity 基礎設施來設計你的產品。如果你的產品需要驗證內容是否由 AI 產生,這個機制在真實的對抗場景下(有人想繞過的時候)不夠可靠。
更務實的方向是看 C2PA 標準。如果你在做 content pipeline,考慮在 metadata 層加入來源記錄,而不是依賴輸出文字本身的統計特性。
如果你是企業決策者:
別把 watermarking 的 checkbox 當成真正的風險管理。監管合規是一回事,但如果你的業務真的需要區分人工寫作和 AI 寫作(例如學術機構、新聞媒體),不要過度依賴這個機制。
如果你是一般用戶:
這個功能對你的日常使用基本沒有影響,也沒有要改變什麼的必要。唯一要注意的是:不要誤以為 AI 生成的內容現在有什麼可靠的「防偽標籤」— 沒有。
老實說,整件事最值得觀察的不是技術本身,而是監管機構接下來怎麼回應。如果 EU AI Act 的執行機構認為 statistical watermarking 達不到他們的要求,Anthropic 這一步棋的意義就更有限了。後續怎麼走,就不得而知了。
延伸閱讀
Waiting7777
WoW Arena 冠軍轉前端,用電競 meta 思維拆解技術趨勢。
相關文章
CodexClaude+2用了一週 Codex 之後,我才知道它跟 Claude 適合做不同的事
從實際使用對比切入,聊 Codex 跟 Claude 各自的強項和弱點,給工程師一個選工具的參考框架,不要只講功能,要講什麼時候選哪個。
2026年8月25日 · Waiting7777 · 8 分鐘閱讀
繼續閱讀 →
AI開發者文化+3Don't Paste the AI — 為什麼直接貼 AI 輸出是個壞習慣
從開發者的角度談「AI 貼上文化」的實際傷害 — code review 品質下降、文件失真、溝通失去人味,並帶入個人觀點:AI 是工具,不是直接貼上的理由。
2026年8月22日 · HW SHU · 7 分鐘閱讀
繼續閱讀 →
AI商業模式+3AINS 是下一個 SaaS?AI 時代的軟體商業模式要怎麼想
SaaS 的訂閱模式跑了二十年,現在 AI Native Software 要用完全不同的定價邏輯重新洗牌 — 分析誰會贏、誰會被取代,以及這對工程師職涯的影響。
2026年8月21日 · HW SHU · 8 分鐘閱讀
繼續閱讀 →這篇文章對你有幫助嗎?
每週一篇 — 技術趨勢背後的商業邏輯
AI 產業在變什麼、工程師該注意什麼——拆清楚寄到你的信箱。