🚨 AI-LECTURER 快訊速報|2026-08-16|5 分鐘速讀

🚨 新版 Claude/Gemini 悄悄在文字裡加浮水印,原理一次搞懂

取材:How AI text watermarking works(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
阿凱,接案部落格寫手,常用 Claude 打草稿再自己潤稿

他剛用 Claude 寫完一篇技術文章草稿,潤稿後打算直接貼上自家部落格發布

😖 卡住的地方:看到新聞說 2026 年 8 月起新版 Claude 會在文字裡偷偷加浮水印,他很慌:自己改寫過的段落,浮水印還抓得到嗎?會不會被平台誤判成『未經修改的 AI 產出』
💡 讀完你就懂浮水印藏在哪、為什麼改寫幾個字它還在,以及要怎麼親自測一段文字有沒有被動過手腳

⚡ 一句話講清楚

文字要藏浮水印聽起來不可能——圖片可以把資料藏進像素裡,文字複製貼上後所有格式、metadata 全部消失,你看到的就是一串字,哪裡還能動手腳?但事實是 Google 從 2024 年起,已經在 Gemini App 與網頁版輸出的文字裡加了浮水印(目前只有 API 是例外),2026 年 8 月起新版 Claude 也開始在模型層級加浮水印,舊版模型之後會陸續跟進。秘密不藏在字裡,而藏在「選哪個詞」這個動作本身。

模型寫句子時,其實不是只有一個「正確答案」。走到 分岔點一句話寫到一半、還有好幾個詞都說得通、可以任選其中之一接下去的地方,要選哪一個詞,靠的是 權重骰子模型依照每個候選詞的可能性高低去擲一顆不公平的骰子,機率高的詞比較容易雀屏中選,但不保證每次都選機率最高的那個。浮水印的做法,是先用一把只有製造者知道的 密鑰一組秘密數字,用來把每次要選的候選詞分成「綠色組」跟「紅色組」,沒有這把鑰匙就無法還原分組,把候選詞分成綠色組跟紅色組,再把骰子悄悄往綠色那邊推一點。紅色詞還是有機會中選(只是機率被壓低),而且同一個詞在不同的上下文底下,這次可能被分到綠色、下次可能被分到紅色——因為分組是根據「前面幾個字」現算出來的,不是詞本身固定的顏色。

要偵測有沒有浮水印,不是看文字寫得順不順,而是拿同一把密鑰把整篇文章重新分組一次,數一數「綠色詞」出現的比例。沒被動過手腳的文字,綠色詞大概只會出現一半左右(純巧合);被加了浮水印的文字,綠色詞出現的比例會明顯偏高,這就是 統計偵測不用主觀判斷文字風格,而是用機率統計,計算特定分組的詞出現頻率是否顯著高於巧合值,藉此判斷文字是否被動過手腳 的原理。Google 的 SynthID 用的是更細緻的「小型錦標賽」做法,OpenAI 內部研究的方案則是直接用密鑰算出骰子怎麼轉,做法不同但道理一樣:印記藏在選字的過程裡,不藏在字本身。

🏃 快速上手三步(今天就能做)

1
查清楚你用的工具有沒有加浮水印打開你常用的 AI 工具官方公告頁(例如 Anthropic 的模型說明或 Google Gemini 的更新日誌),搜尋關鍵字「watermark」或「浮水印」,確認你現在用的版本、介面(App/網頁版 vs. API)是否在已啟用清單內——這篇素材提到 2026 年 8 月起新版 Claude 開始加,但 API 目前不受影響,你的用法可能根本不受影響。
2
拿一段AI寫的文字自己測一次把最近一段用 AI 生成、且幾乎沒有大幅修改的文字,貼到你能找到、評價可信的 AI 文字偵測工具(先搜尋『AI text detector 評測』挑一個口碑好的),觀察它給出的『疑似AI生成機率』;接著把同一段文字自己動手改寫三到五成的用字,再測一次,比較兩次結果的差異,直觀感受浮水印在改寫後有多容易失效。
3
訂出你自己的『AI協助標示』判斷標準如果你會公開發表 AI 協助寫的內容(部落格、報告、作業),先問自己:平台或單位有沒有要求標示 AI 協助?有的話,別靠『改寫到偵測不出來』當作合規做法——浮水印和偵測技術都在快速進化,統計方法抓的是機率分佈不是字面用詞,改寫不保證洗掉痕跡;乾脆直接誠實標示,比賭偵測工具抓不到更省風險。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 浮水印的『綠色機率調高一點點』,會不會讓AI寫出來的文字品質變差?
這正是這套機制的權衡核心。調得越明顯(紅綠差距拉大),偵測越準,但每個字都被迫往「不一定是最適合」的方向偏,長文章下來風格、用字可能變得微妙地不自然;調得越溫和,文字品質幾乎不受影響,但偵測的把握度也跟著下降,需要夠長的文本累積夠多的『分岔點』才能在統計上站得住腳。所以短文字(例如一則推文)幾乎測不準,長文字才是這套技術真正可靠的場景。
🔭 同一段文字被翻譯、摘要,或請另一個沒有浮水印的AI改寫過一輪,浮水印還在嗎?
多半不在了。因為浮水印依賴的是「這個字前面接了哪幾個字」來重新計算顏色分組,只要文字的詞序、用字被大幅打散重組(翻譯成另一種語言、找別的模型大幅改寫、甚至只是人工重新排版整段),原本用來對齊分組的『前綴』就對不上了,密鑰重新分組出來的結果會跟原文脫鉤,統計上就看不出偏差。這也是為什麼各家公司會把浮水印當作『事後追蹤與研究用的訊號』,而不是能百分之百防堵抄襲或造假的保證。