📍 真實場景
小雨,32歲,在一間中型行銷顧問公司當接案文案編輯,除了自己寫稿,也要審核外包寫手與工讀生交回來的初稿,決定哪些能直接送客戶、哪些要退回重寫
她最近開始用Claude幫忙生成部落格草稿再自己潤飾,同時也負責審其他寫手交來的稿子,懷疑其中幾篇根本是整篇丟給AI生出來的,但單憑「讀起來的語感」很難認定,怕誤會了認真寫稿的同事、也怕漏抓真的偷懶的人
😖 卡住的地方:她剛看到新聞說Claude從2026年8月起會在生成的文字裡「加浮水印」,一頭霧水:文字又沒有畫素、複製貼上也不會留下隱藏檔案標籤,這浮水印到底加在哪裡?搞不懂原理,她就沒辦法判斷手上的AI偵測工具是不是真的可靠,也答不出客戶那句「這篇是不是AI寫的」
💡 讀完這篇,你會懂浮水印其實藏在AI「選字」的機率裡而不是字本身,也會明白為什麼AI偵測工具只能給「統計上像不像AI寫的」而不是100%鐵證,下次被客戶或同事質疑一篇稿子的來源時,你能講出具體原理,而不是憑感覺猜
⚡ 一句話講清楚
AI寫文章不是一個字一個字「決定好」再打出來,而是每寫到一個地方,腦中其實同時列出好幾個差不多通順的候選字AI每次要吐出下一個字或詞時,腦中同時列出的好幾個差不多通順的選項,然後照機率骰骰子選一個。像「這次研究結果相當___」後面可以接「顯著」「驚人」「有限」,換哪一個意思都通。一整篇文章有幾百個這種岔路,很多岔路上好幾個選項都一樣好,這個「隨便選都可以」的空間,就是浮水印能藏身的地方。
Kirchenbauer等人在2023年提出的經典做法是:在每個岔路上,用一把只有出浮水印那方知道的金鑰只有加浮水印的人自己知道的一串秘密參數,用來決定哪些候選字算「綠色」哪些算「紅色」,把候選字隨機分成綠色和紅色兩堆,然後把骰子稍微往綠色那邊調重一點。這個顏色不是某個字固定的標籤,而是根據「前面幾個字是什麼」動態算出來的,所以同一個詞在不同句子脈絡下,這次是綠色、下次可能變紅色——這樣就算有人蒐集大量文字,也很難反推出固定規律去破解。Google正式產品SynthID走的是另一條路:用小型錦標賽方式從模型自己的機率中抽幾個候選字讓金鑰打分數,賽制設計成平均下來不會改變模型原本想選的機率,盡量不犧牲文字品質;建於OpenAI的Aaronson方案則更直接,骰子本身怎麼骰就是由金鑰算出來的。做法不同,藏東西的地方是同一個:字與字之間的選擇機率。
偵測的時候,不需要讀懂文章在講什麼,只要拿同一把金鑰把文字重新上色一次,數一數綠色出現的比例。沒被動過手腳的文字,因為選字本來就是隨機的,綠色比例會接近五成,像丟銅板一樣;被加了浮水印的文字,因為骰子被動過手腳,綠色比例會明顯偏高,高到用機率計算可以判定統計顯著結果偏離到不太可能是巧合,可以用機率計算讓人有信心地說「這不是碰運氣」,不是巧合。這也代表偵測結果從來不是「是」或「不是」的鐵證,而是一個機率傾向。
🏃 快速上手三步(今天就能做)
1
查:確認你在用的AI工具現在有沒有加浮水印打開Anthropic和Google目前公開的模型說明或更新紀錄,搜尋「watermark」或「浮水印」關鍵字,確認你實際在用的模型版本是否在名單內。目前已知Google從2024年起替Gemini App與網頁版輸出加浮水印(但API是文件上明列的例外),Claude則是2026年8月起新模型開始加、舊模型陸續跟進——版本不同、通路不同(網頁版vs. API),結果可能不一樣,要查清楚你用的是哪一種。
▼
2
試:拿一段AI生成文字對照一段自己純手寫的文字把手邊一段確定是AI直接生成、未經大幅修改的段落,和一段你自己從頭寫的段落放在一起讀,感受兩者在「用字自由度」上的差異——不是要你用肉眼分辨浮水印,而是建立一個判斷基準:AI偵測工具給出的百分比,本質上是「候選字被系統性微調過的統計傾向」,不是逐字比對出來的鐵證,親手做過一次對照才會有感。
▼
3
注意:溝通時用「機率傾向」取代「一定/絕對」跟客戶或團隊回報AI偵測結果時,改講「這篇文字統計上AI生成的機率偏高,但不是100%鐵證」,並主動提醒:文字若經過大幅改寫、翻譯或摘要,字與字之間的選擇順序會被打散,浮水印的綠色比例統計就會被破壞、準確度下降。若結果牽涉重大決定(例如學術誠信案件、合約糾紛),一定要搭配官方偵測工具加上人工複核,不能只憑單一線上偵測網站給的一個分數就下最終結論。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 把骰子往綠色調得越重,是不是就越好抓?
調重能提高偵測靈敏度,但代價是模型被迫更常選同一批「綠色」字,可能讓語氣變得不自然、用詞重複、創造力下降;調輕則文字品質幾乎不受影響,但短文本(像一則社群貼文)樣本數不夠,統計上很難達到「顯著偏離五成」的門檻,反而容易漏抓。這是工程師必須在「可偵測性」和「生成品質」之間拿捏的取捨,沒有一個數字能同時滿足兩邊。
🔭 為什麼顏色要綁定「前面幾個字的組合」,而不是乾脆給每個詞固定分配顏色?
如果顏色是詞彙的固定屬性,只要蒐集夠多被加浮水印的文字,統計上就能反推出哪些詞是綠色、進而猜出金鑰邏輯,規則等於半公開。把顏色綁在前幾個字的脈絡組合上,同一個詞在不同句子裡會被分到不同顏色,大幅提高破解難度;但這個設計也有反面代價——如果原文被大幅改寫、翻譯或打亂語序,前後文脈絡整組換掉,浮水印賴以判斷的顏色分佈就會被打散,偵測率隨之下降。這是「防破解的安全性」與「抵抗改寫的穩健性」之間的取捨,兩者很難同時最大化。