KeyFrame內部研究專用

S2E67 AI 浮水印深入解析:為什麼 OpenAI 做好了卻不敢用?

矽谷輕鬆談·8月16日週日·18 min中文

三句話摘要

歐盟AI法案推動AI生成內容浮水印技術,講解圖片、聲音、影像、文字四模態的浮水印原理、驗證方式與現有限制。 AI浮水印是監管要求的必然技術,但現有實現仍受廠商壟斷驗證、標準碎片化、文字易被繞過等根本性限制,零知識驗證與行業標準統一可能是破局的關鍵。 AI使用的必要性與倫理判斷:應根據創作本質決定。核心創意工作(寫作、視頻製作)應減少AI使用以保留個人風格;輔助性工作(社群文案、圖片生成)使用AI無害,時間背景也影響判斷——2026年AI已成工作必需而非選擇。

重點整理

重點
  • 1

    AI使用的必要性與倫理判斷:應根據創作本質決定。核心創意工作(寫作、視頻製作)應減少AI使用以保留個人風格;輔助性工作(社群文案、圖片生成)使用AI無害,時間背景也影響判斷——2026年AI已成工作必需而非選擇。

  • 2

    多模態浮水印技術架構:圖片、聲音、影像都採編碼器-解碼器組合,通過修改pixel亮度、頻譜圖位置等不可感知特徵嵌入信息;文字因操作空間受限,改採統計概率方法區分人寫與AI寫的文本。

  • 3

    文字浮水印的兩代技術:紅綠燈法根據前文+私鑰將候選字分組並調整概率,Google的改進版G值法則為每字分配0/1值但保持原始機率分布,後者品質更好但兩者都易被短文本、高確定性文本或跨模型改寫破壞。

  • 4

    浮水印技術的三大痛點:只有廠商能驗證(無第三方機制)、各廠商標準不一致(跨模型改寫失效)、文字易被繞過(翻譯改寫等),其中零知識驗證與統一行業標準被視為潛在解法。

實用技巧與重點

乾貨
  • 法規與現狀
  • EU AI Act生效日期:8月2日(新模型);12月2日(舊模型)
  • 受影響廠商:Google、OpenAI、Anthropic等全球主流模型
  • OpenAI 2024年文字浮水印準確度99.99%,但30%用戶反感,現已擱置
  • 圖片浮水印
  • 原理:修改pixel亮度或加入噪點,保留人眼不可見的pattern
  • 特點:魯棒性強,經壓縮、降解析度、裁減後仍可檢測
  • 聲音浮水印
  • 原理:波形轉頻譜圖(橫軸時間、縱軸頻率)→在人耳難察覺位置加線索→轉回音波
  • 特點:隱藏於頻率-時間維度,難以察覺
  • 文字浮水印方法一(紅綠燈法)
  • 步驟:根據前文+私鑰→產生種子→將候選字分為紅組(降概率)與綠組(提概率,約5:5比例)→保持概率調整而非禁止
  • 驗證:統計文中綠字比例,AI文本>50%,人寫文本≈50%
  • 缺點:調整機率導致長文質量下降,短文驗證失敗率高
  • 文字浮水印方法二(G值法)
  • 步驟:為每個候選字分配G值(0或1)→選字時執行兩次→保留G值較高的字
  • 驗證:計算平均G值,AI文本>0.5,人寫文本≈0.5
  • 優點:保留原始機率分布,品質更好
  • 繞過方式
  • 翻譯轉換(日文→英文→回中文)改變節奏順序
  • 跨模型改寫(不同廠商私鑰導致G值分布不同)
  • 代碼等高確定性文本難以驗證
  • 零知識驗證(Zero Knowledge Proof)
  • 概念:不透露解法情況下證明內容真實性
  • 類比:「找威利」遊戲,用白紙挖洞對準答案位置示範

結論

結論

AI浮水印是監管要求的必然技術,但現有實現仍受廠商壟斷驗證、標準碎片化、文字易被繞過等根本性限制,零知識驗證與行業標準統一可能是破局的關鍵。

完整解析

詳細

歐盟AI法案於8月2日生效,強制要求所有AI生成內容均需加註浮水印標記。由於AI模型無法識別用戶地理位置,全球使用者實際上都將面臨這項要求,舊模型緩衝期至12月2日。Google、OpenAI等主流廠商都在受影響之列。

不同模態的浮水印實現邏輯差異巨大。圖片、聲音、影像都遵循編碼器-解碼器架構:編碼器負責在內容中嵌入基於私鑰生成的不可感知信號,解碼器負責檢測並給出0到1的概率評分。以聲音為例,系統先將波形轉換為頻譜圖(橫軸代表時間,縱軸代表頻率,亮度代表聲音強度),在人耳難以察覺的頻率-時間交界處加入線索,再轉回音波形式。這類方法的強點是魯棒性——即使經過壓縮、降低解析度或編輯,浮水印依然可被檢測。

文字領域面臨完全不同的挑戰。文本缺乏隱藏信息的空間,因此採用統計概率方法。最初的「紅綠燈法」根據前文加上密鑰生成種子,隨機將候選字分為兩組:紅組(降低被選概率)與綠組(提高被選概率),維持約5:5的比例。關鍵設計是調整而非禁止,避免破壞「1+1等於2」這類確定性答案。驗證時,系統重新計算綠字的出現比例,AI生成文本中綠字應明顯超過50%,而人寫文本由於對紅綠分組一無所知,綠字比例應接近50%。

Google提出的改進版本採用G值法,概念更優雅。系統為每個候選字賦予0或1的G值,選詞時執行兩次並保留G值較高的字。這樣做的優勢是完全保留模型的原始機率分布,避免品質下降,同時通過平均G值計算(AI文本應>0.5,人寫文本應≈0.5)進行驗證。

關於AI使用的必要性,講者提出了微妙的倫理判斷。不同工作性質應有不同態度:對寫作、視頻製作等本質上是個人創意表達的工作,應盡量避免AI介入,因為這些是藝術創作過程本身;但對社群文案、圖片生成等純粹的工具性應用,AI使用無可厚非。講者以自己為例,視頻製作是核心創意,不會用AI替身,但文字對他只是表達工具,樂於交給AI處理。時間背景也很重要——2024年時AI還是選擇性工具,但到2026年已成為工作必需品,人們對浮水印的看法可能已然改變。

當前技術存在三個根本性痛點。第一,驗證必須依賴廠商的私鑰,只有廠商自己能驗證自家浮水印,無法進行獨立第三方驗證。第二,各廠商採用不同標準與私鑰,導致跨模型改寫會破壞浮水印——若用Claude改寫OpenAI的文本,因為兩家私鑰和G值分布完全不同,原浮水印信號就會失效。第三,文字浮水印相對容易繞過,翻譯、改寫、模型轉換都能破壞信號,因為文本本身沒有如圖像那樣的隱藏空間。

解決方案正在探討中。零知識驗證被視為可能的答案——在不洩露私鑰的前提下,通過數學證明讓第三方確認內容確實來自某個AI模型。類比是「找威利」遊戲,用白紙挖洞對準答案位置,只證明你找到了答案而不透露答案本身。行業統一標準則能解決跨廠商驗證的問題。值得注意的是,這些繞過手段多數造成的是假負例(實際為AI卻未被檢測),真正的假正例(人寫被誤判為AI)相對罕見,因為不小心寫出AI風格文本的概率較低。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。