全部集數

067 · AI 浮水印怎麼做,又怎麼被繞過

歐盟新法逼著所有生成模型加上浮水印。從圖片、聲音、影片一路講到文字,拆開紅綠燈與 G 值兩種做法,也說明為什麼翻譯繞一圈就能讓它失效。

2026-08-1618:47產業觀察研究GoogleOpenAI看原片

原標題:AI 浮水印深入解析:為什麼 OpenAI 做好了卻不敢用? | S2E67

重點摘要

  • 歐盟法案訂好了時程8 月 2 號起,新模型產出的文字、圖片、聲音、影像都要帶浮水印。舊模型有 4 個月緩衝,12 月 2 號也要跟上。
  • 影響不只歐盟用戶模型分不出你人在哪裡,所以 Gemini、OpenAI、Grok 這些主流模型等於全世界都會帶上這個功能。
  • OpenAI 做好了卻收起來2024 年的文字浮水印號稱準確度 99.99%,但問卷裡有 30% 的用戶說會因此少用 ChatGPT,功能就一直擱置到現在。
  • 圖片、聲音、影片是同一套一個 encoder 負責嵌浮水印,一個 decoder 負責辨識,最後給出 0 到 1 的機率。聲音先轉成頻譜圖,在人耳不容易察覺的頻段藏線索。
  • 文字浮水印有兩代做法紅綠燈法把候選字分成紅綠兩組、調高或調低被選中的機率;SynthID 改成給每個字一個 G 值,抽兩次留下 G 值高的那個,機率分佈不受影響,品質比較好。
  • 難處全卡在私鑰浮水印只有模型商自己能發、能驗,沒有通用標準。換一家模型改寫、或翻譯繞一圈再翻回來,浮水印就失效了。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Anthropic 要在所有文字模型產出加浮水印,起因是歐盟 AI 法案 8 月 2 號生效。
00:31影響範圍受影響的不只一家,主流模型都要做;模型無從判斷使用者是不是歐洲人,等於全球適用。
01:18SynthID 的起點Google 在 2023 年推出 SynthID,先做圖片,靠調整亮度或加噪點,人眼看不出來。
02:06OpenAI 為何擱置文字浮水印 2024 年就快完工,準確度號稱 99.99%,卻因為問卷結果被收進抽屜。
03:09創作該不該用 AI答案看目的:創作本身讓你享受就少用,只是達成目的的手段就放心交出去。
05:11圖片與影片的做法encoder 與 decoder 一起訓練,壓縮、裁切、抽幀之後通常還是驗得出來。
06:45聲音的做法波形先轉成頻譜圖,在圖上加 pattern 再轉回音波,線索藏在人耳不敏感的頻段。
07:49紅綠燈法用前文加私鑰產生種子,把候選字分成紅綠兩組,綠組機率調高、紅組調低。
09:20同一個字不同分組種子隨前文變動,所以同一個字在文章不同位置會被分到不同組,避免整篇偏移。
09:51怎麼驗證拿同一把金鑰重算綠色字的比例,人寫的接近 50 50,有浮水印的會統計上明顯偏高。
10:53SynthID 加強版改給每個候選字一個 0 或 1 的 G 值,抽兩次留 G 值高的,選字仍照原本機率,品質較好。
12:41方法的限制文字太短、候選字太少辨識率就低;程式碼即使篇幅長也很難分辨人寫還是機器寫。
13:27私鑰是最大限制私鑰不能公開,第三方無從驗證。零知識驗證是可能的出路,用尋找威利的比喻說明。
15:46沒有通用標準各家私鑰不同,Gemini 的文字丟給 Claude 改寫再驗,就會得到「不是 AI 產生」的答案。
16:31防君子不防小人翻成日文再翻英文再翻回來就能打亂節奏;誤判偏向 false negative,false positive 少。

值得記的話

如果你加入了這個 AI 的浮水印,我可能就會減少使用我 ChatGPT 的頻率了

02:22

即便 2024 就將近完工了,他們還是把它隱藏到了現在

02:38

我們是調整機率並不是禁止嘛,所以即便你是被選到紅色組,你這些字還是有機會被選到。

08:49

它是防君子不防小人啦,就是你只要有心,你還是可以蠻容易的就繞過這些限制

16:31

false positive 就是你人要去寫,然後不小心被誤判成 AI 寫,這件事情本身相對困難啦

17:17

名詞與人物

歐盟 AI 法案8 月 2 號生效,新模型產出必須標示為 AI 生成,舊模型 12 月 2 號前跟上。
SynthIDGoogle 在 2023 年推出的浮水印架構,從圖片起家,後來擴到影片、聲音與文字。
encoder / decoder一對一起訓練的神經網路,前者把浮水印嵌進內容,後者給出 0 到 1 的判斷機率。
紅綠燈法2023 年文字浮水印論文的做法,用私鑰加前文產生種子,把候選字分成紅綠兩組調整機率。
G 值 / G functionSynthID 文字版的做法,每個候選字拿到 0 或 1 的值,抽兩次取高者,不動原本的機率分佈。
零知識驗證不透露解法也能證明自己有解法,用來讓第三方在拿不到私鑰的情況下驗證浮水印。
false negative明明是 AI 產生卻驗不出來,這集認為這類誤判機率最大,反過來的誤判則少見。

延伸

  • 提到創作者曼尼:寫作是把腦中想法形塑出來的藝術創作,最多讓 AI 幫忙糾錯,不會把創作本身交出去。
  • 零知識驗證只講到尋找威利的比喻和大方向,實際怎麼跟浮水印架構接起來沒有展開。
  • 圖片、影片、聲音的做法大多是外界推測,論文資訊少;只有文字這塊有明確的公開論文可讀。

原始出處