OpenAI 將在歐盟為 ChatGPT 與 Codex 產生的文字嵌入「隱形浮水印」,不過依該公司自家測試,只要替換約 10% 的字詞,偵測成功率就會從約 92% 掉到 66%。
重點整理:
- 未來數週內,歐盟地區所有方案的合格 ChatGPT 與 Codex 用戶都會陸續上線此浮水印;API 端則維持為選用功能。
- 在內部評估中,若將 25% 的字詞替換成同義字,偵測率進一步降到僅剩 17%。
- 初期偵測工具僅開放給審核通過的研究人員與專業機構使用。
OpenAI 浮水印上線規劃
公司在部落格公告中表示,未來幾週將陸續為歐盟地區、所有付費方案與免費方案中符合條件的 ChatGPT 與 Codex 用戶啟用文字浮水印。這項機制在上線階段不會直接成為全球預設。
全球各地的開發者,目前即可透過 OpenAI 的 API,為特定模型啟用浮水印功能,但預設依然為關閉。此舉主要是回應《歐盟 AI 法》,該法自 8 月 2 日起要求業者必須讓機器能辨識 AI 產出的文字內容。已在市場營運的公司必須在 12 月 2 日前完成符合規定。
延伸閱讀:幣安 AI 交易代理可用自然語句生成策略,每次交易收 19.99 USDC 費用
textGrain 偵測機制與極限
OpenAI 將這套方法命名為「textGrain」,它不會在畫面上留下任何明顯符號,而是透過微調模型選字偏好,寫入特定統計特徵,讓偵測工具可以在文字中讀出這個訊號,且即使文字被複製轉貼,浮水印仍會隨之帶走。
OpenAI 表示,textGrain 在內部測試中,不論準確率或穩定度,都可與、甚至優於其他方案,包括 Google 用於文字的 SynthID,且公司計畫最終將這項技術開源。
不過,只要後續有人為編修,訊號就會顯著變弱。
在長度約 400 token 的段落測試中,只將 10% 的字詞替換為同義字,偵測率便從約 92% 掉到 66%;若替換 25% 字詞,偵測率更被壓低到僅 17%。此外,篇幅較短的內容、數學解答,以及翻譯後的文字,也更難被標記出來;在心理學等主題、篇幅約 200 token 的內容上,偵測工具在 1% 誤判率下,大約能抓到 80% 帶有浮水印的段落。
ChatGPT 浮水印偵測工具的使用範圍
目前 OpenAI 僅將偵測工具提供給審核通過的研究人員與專業組織,理由是仍存在漏判與誤判風險。OpenAI 也強調,偵測不到浮水印,「並不能證明」該段文字一定由人類撰寫;同時,浮水印本身不會記錄或透露使用者身分、帳戶資訊或輸入提示內容。
此一布局接續了 Anthropic 的腳步。Anthropic 早在 8 月就宣布,將為其大模型 Claude 所產生的文字在全球加上浮水印,但該決定曾引發部分用戶反彈。OpenAI 過去其實也曾開發過文字浮水印技術,但據 2024 年媒體報導,公司當時考量用戶可能因此轉向競品,而選擇暫緩推出。
目前 OpenAI 與 Anthropic,以及 Google、Meta、Microsoft 等科技巨頭,皆已承諾遵守歐盟針對 AI 生成內容的透明度實務準則。

