067 · AI 浮水印怎麼做,又怎麼被繞過
歐盟新法逼著所有生成模型加上浮水印。從圖片、聲音、影片一路講到文字,拆開紅綠燈與 G 值兩種做法,也說明為什麼翻譯繞一圈就能讓它失效。
原標題:AI 浮水印深入解析:為什麼 OpenAI 做好了卻不敢用? | S2E67
重點摘要
- 歐盟法案訂好了時程8 月 2 號起,新模型產出的文字、圖片、聲音、影像都要帶浮水印。舊模型有 4 個月緩衝,12 月 2 號也要跟上。
- 影響不只歐盟用戶模型分不出你人在哪裡,所以 Gemini、OpenAI、Grok 這些主流模型等於全世界都會帶上這個功能。
- OpenAI 做好了卻收起來2024 年的文字浮水印號稱準確度 99.99%,但問卷裡有 30% 的用戶說會因此少用 ChatGPT,功能就一直擱置到現在。
- 圖片、聲音、影片是同一套一個 encoder 負責嵌浮水印,一個 decoder 負責辨識,最後給出 0 到 1 的機率。聲音先轉成頻譜圖,在人耳不容易察覺的頻段藏線索。
- 文字浮水印有兩代做法紅綠燈法把候選字分成紅綠兩組、調高或調低被選中的機率;SynthID 改成給每個字一個 G 值,抽兩次留下 G 值高的那個,機率分佈不受影響,品質比較好。
- 難處全卡在私鑰浮水印只有模型商自己能發、能驗,沒有通用標準。換一家模型改寫、或翻譯繞一圈再翻回來,浮水印就失效了。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Anthropic 要在所有文字模型產出加浮水印,起因是歐盟 AI 法案 8 月 2 號生效。 |
| 00:31 | 影響範圍 | 受影響的不只一家,主流模型都要做;模型無從判斷使用者是不是歐洲人,等於全球適用。 |
| 01:18 | SynthID 的起點 | Google 在 2023 年推出 SynthID,先做圖片,靠調整亮度或加噪點,人眼看不出來。 |
| 02:06 | OpenAI 為何擱置 | 文字浮水印 2024 年就快完工,準確度號稱 99.99%,卻因為問卷結果被收進抽屜。 |
| 03:09 | 創作該不該用 AI | 答案看目的:創作本身讓你享受就少用,只是達成目的的手段就放心交出去。 |
| 05:11 | 圖片與影片的做法 | encoder 與 decoder 一起訓練,壓縮、裁切、抽幀之後通常還是驗得出來。 |
| 06:45 | 聲音的做法 | 波形先轉成頻譜圖,在圖上加 pattern 再轉回音波,線索藏在人耳不敏感的頻段。 |
| 07:49 | 紅綠燈法 | 用前文加私鑰產生種子,把候選字分成紅綠兩組,綠組機率調高、紅組調低。 |
| 09:20 | 同一個字不同分組 | 種子隨前文變動,所以同一個字在文章不同位置會被分到不同組,避免整篇偏移。 |
| 09:51 | 怎麼驗證 | 拿同一把金鑰重算綠色字的比例,人寫的接近 50 50,有浮水印的會統計上明顯偏高。 |
| 10:53 | SynthID 加強版 | 改給每個候選字一個 0 或 1 的 G 值,抽兩次留 G 值高的,選字仍照原本機率,品質較好。 |
| 12:41 | 方法的限制 | 文字太短、候選字太少辨識率就低;程式碼即使篇幅長也很難分辨人寫還是機器寫。 |
| 13:27 | 私鑰是最大限制 | 私鑰不能公開,第三方無從驗證。零知識驗證是可能的出路,用尋找威利的比喻說明。 |
| 15:46 | 沒有通用標準 | 各家私鑰不同,Gemini 的文字丟給 Claude 改寫再驗,就會得到「不是 AI 產生」的答案。 |
| 16:31 | 防君子不防小人 | 翻成日文再翻英文再翻回來就能打亂節奏;誤判偏向 false negative,false positive 少。 |
值得記的話
名詞與人物
| 歐盟 AI 法案 | 8 月 2 號生效,新模型產出必須標示為 AI 生成,舊模型 12 月 2 號前跟上。 |
|---|---|
| SynthID | Google 在 2023 年推出的浮水印架構,從圖片起家,後來擴到影片、聲音與文字。 |
| encoder / decoder | 一對一起訓練的神經網路,前者把浮水印嵌進內容,後者給出 0 到 1 的判斷機率。 |
| 紅綠燈法 | 2023 年文字浮水印論文的做法,用私鑰加前文產生種子,把候選字分成紅綠兩組調整機率。 |
| G 值 / G function | SynthID 文字版的做法,每個候選字拿到 0 或 1 的值,抽兩次取高者,不動原本的機率分佈。 |
| 零知識驗證 | 不透露解法也能證明自己有解法,用來讓第三方在拿不到私鑰的情況下驗證浮水印。 |
| false negative | 明明是 AI 產生卻驗不出來,這集認為這類誤判機率最大,反過來的誤判則少見。 |
延伸
- 提到創作者曼尼:寫作是把腦中想法形塑出來的藝術創作,最多讓 AI 幫忙糾錯,不會把創作本身交出去。
- 零知識驗證只講到尋找威利的比喻和大方向,實際怎麼跟浮水印架構接起來沒有展開。
- 圖片、影片、聲音的做法大多是外界推測,論文資訊少;只有文字這塊有明確的公開論文可讀。
原始出處
- SynthID — Google DeepMind 官方頁面證實 SynthID 是 Google DeepMind 的浮水印技術,同時涵蓋文字、圖片、音訊與影片,與筆記描述的做法一致。
- A Watermark for Large Language Models (Kirchenbauer et al., arXiv 2301.10226)文字浮水印「紅綠燈法」原始論文,證實把候選字分成紅綠兩組、調高綠組被選中機率的做法。
- Commission publishes second draft Code of Practice on marking and labelling AI-generated content(歐盟執委會官方頁面)歐盟官方頁面證實 AI Act 第 50 條對 AI 生成內容的標示規範將於 2026 年 8 月 2 日起適用,與筆記提到的生效時程一致。