🚨 AI-LECTURER 快訊速報|2026-08-16|5 分鐘速讀

🚨 Claude 生成的文字要「隱形蓋章」了——浮水印怎麼運作?

取材:How Claude’s text watermark works(Anthropic News)|完整課同日跟進,見書架
📍 真實場景
大學兼任助教,常需批改學生繳交的期末報告

正在改一疊報告,懷疑其中幾份整段都是用 AI 代寫,卻抓不到實質證據

😖 卡住的地方:市面上的「AI 偵測工具」誤判率很高,把學生自己寫的正常句子也判成 AI 生成,讓你不敢直接拿分數去質問學生
💡 讀完你會知道:Claude 的浮水印能證明什麼、不能證明什麼,以後看到「AI偵測報告」該怎麼判讀而不是照單全收

⚡ 一句話講清楚

Anthropic 宣布,之後的 Claude 模型會在生成的文字裡自動加上 浮水印(watermark)藏在內容裡、不影響觀感但可被特定方法偵測出來的隱藏標記,用來判斷「這段文字有多大機率是 Claude 寫的」。這個動作是為了配合 2026 年 8 月上路的 歐盟AI法案(EU AI Act)歐盟訂定的AI監理規範,要求在歐盟市場提供服務的AI業者必須標示AI生成內容,而且不只 Anthropic,其他簽署同一份規範的主要 AI 業者也會各自推出自己的浮水印。

運作原理跟你想的「藏字」完全不同。大型語言模型(LLM)像Claude這樣一次只預測一個字/詞的AI模型 每次選下一個字時,其實是從一份候選清單裡挑,例如「今天天氣又冷又…」後面接「陰沉」還是「灰濛濛」,意思差不多,選哪個通常交給 亂數產生器(random number generator)決定「隨機」結果的演算法元件 丟骰子決定。Anthropic 的做法是把這個「丟骰子」的來源,換成用一把只有官方持有的密鑰(key)搭配前面幾個字去計算出來的偽隨機結果——文字讀起來一模一樣,但只要有這把 key,就能檢查整段文字的選字規律是否符合「Claude 用這把 key 會選的樣子」,進而算出一個「這是 Claude 寫的」機率。

它刻意做得很「乾淨」:不會多加字、不會有肉眼看得出的怪符號、也不會因此變貴(不用多花 token)。但也因為原理是機率統計,它只能回答「這段文字像不像用這把 key 生成的」,回答不了「是哪個帳號、哪一次對話生成的」——浮水印本身不帶任何可追蹤到特定使用者或組織的資訊。

🏃 快速上手三步(今天就能做)

1
確認你用的模型版本是否已上浮水印到 anthropic.com/news 或你慣用模型(OpenAI/Google)官方的更新頁面,用關鍵字 watermark 搜尋,確認你正在用的版本號是否已套用;2026 年 8 月之後新產生的對話內容比較可能含浮水印,之前的舊輸出不會回溯加上。
2
看到「AI偵測分數」先問一句:它核對的是哪把 key?下次收到第三方工具給的「92% AI生成」報告,先確認它是靠文字統計特徵猜測(人類寫的簡短生硬句子也容易被誤判),還是真的拿到官方浮水印 key 去核對。目前沒有任何公開第三方工具握有 Anthropic 的 key,所以號稱「能精準核對 Claude 浮水印」的工具都該打問號。
3
把技術限制寫進你的規範,而不是指望技術抓人如果你要管理學生或員工使用 AI,直接在課程規範或公司政策裡寫清楚「AI 可以用到什麼程度、要不要註明」,而不要期待浮水印能當呈堂證供——因為它設計上就無法回溯到具體是誰、哪一次對話生成,技術上做不到單獨定罪某個人。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 浮水印能不能被「洗掉」?
只要把文字丟進另一個模型改寫(paraphrase)一次,選字的統計規律就會被打散,浮水印訊號很容易被中介的改寫步驟破壞。這代表它對「隨手複製貼上交作業」有嚇阻效果,但擋不住刻意規避的人——本質上是低成本嚇阻,不是高強度防偽機制。
🔭 為什麼選擇「完全不影響輸出品質」這條路,而不是加更強、更好偵測的標記?
Anthropic 刻意只在「選哪個字都差不多」的低風險決策點動手腳(如 overcast vs grey),換取讀者完全感覺不到差異,代價是訊號很弱:文字要夠長,統計上才能算出有意義的機率,一兩句話的短文本幾乎偵測不出來。這是工程上「不擾民」與「可偵測性」之間的明確取捨。