RAM

13.5984.51%

OpenAI 推出針對 AI 文本的 “弱效” 水印技術

LongbridgeAI我是 LongbridgeAI,我可以總結文章信息。

為遵守歐盟《人工智能法案》,OpenAI 正通過其 “textGrain” API 實施文本水印技術,對歐盟境內符合條件的 ChatGPT 和 Codex 輸出內容進行標記。儘管 Anthropic 採用 SynthID 技術實施全球水印,OpenAI 的方案則允許 API 客户選擇是否在全球範圍內應用。然而,該技術因在短篇或功能性文本中檢測率較低,且易被簡單的詞語替換所破解而受到批評

為嚴格遵守歐洲《人工智能法案》的字面規定,OpenAI 現在向 API 客户提供選項,可對特定模型的輸出添加水印。此外,該公司計劃在幾周內,不論用户意願如何,對歐盟境內符合條件的 ChatGPT 和 Codex 文本輸出應用某種形式的數字水印。

但與競爭對手 Anthropic 不同,OpenAI 並未將水印技術應用於歐洲以外地區生成的內容,儘管 API 客户可以選擇在任何地方生成的內容上添加標記。此外,OpenAI 使用的技術會漏掉相當一部分 AI 生成文本,且容易被欺騙。

歐盟《人工智能法案》要求生成式 AI 服務提供商以機器可讀的方式使模型輸出可被識別。

Anthropic 是首家宣佈其《人工智能法案》合規方案的主要 AI 公司,該方案涉及應用谷歌的 SynthID-Text 算法,且在全球範圍內實施。

微軟和 Meta 一直在為基於圖像的 AI 開發類似技術,因為歐盟並非唯一對內容來源及利用 AI 生成內容製造虛假信息的潛力表示擔憂的市場。OpenAI 已經對 AI 生成的圖像、音頻和視頻應用了其他內容來源信號。

為符合《人工智能法案》的字面規定,OpenAI 現在提供一種名為 textGrain [PDF] 的文本水印方法,該方法 “在模型的選詞中添加了不可見的統計信號。我們的檢測器會尋找該信號,以評估段落是否包含 OpenAI 水印。”

大型語言模型會從潛在詞彙的概率分佈中逐個預測詞元。通過定期選擇不同的詞(理想情況下是同義詞)進行輸出,生成的文本會偏離無偏見模型產生的統計模式。OpenAI 僅向經批准的研究人員和組織提供的水印檢測器應能標記這種詞彙差異。

這是理論上的設想,但實際結果各異。目標錯誤率為 1%,但在 200 字的短段落中,檢測器可能僅能標記出 80% 的水印,而在 400 字的段落中這一比例為 95%。在數學或代碼等功能性文本中,結果更差,因為替換更有可能引入錯誤。

textGrain 論文並未解決統計上經過調整的選詞可能改變給定段落含義的可能性。如果算法改變了某些顯著的事實或數據,這種情況就有可能發生。Anthropic 的方法雖然使用不同的算法,但也替換某些輸出詞,帶來類似的風險。

無論如何,OpenAI 的水印很容易通過詞語替換被破解。在對 400 個詞元段落的測試中,用同義詞替換 10% 的詞語後,水印檢測率從 92% 降至 66%。而當替換 25% 的詞語時,僅在 17% 的情況下能檢測到水印信號。

現在,請見證這款勉強夠用但合規的 AI 檢測器的威力…… ®

登錄即免費解鎖557字全文

因資訊版權原因,登錄長橋賬戶後方可瀏覽相關內容
感謝您對正版資訊的理解與支持