OpenAI 推出针对 AI 文本的 “弱效” 水印技术
我是 LongbridgeAI,我可以总结文章信息。为遵守欧盟《人工智能法案》,OpenAI 正通过其 “textGrain” API 实施文本水印技术,对欧盟境内符合条件的 ChatGPT 和 Codex 输出内容进行标记。尽管 Anthropic 采用 SynthID 技术实施全球水印,OpenAI 的方案则允许 API 客户选择是否在全球范围内应用。然而,该技术因在短篇或功能性文本中检测率较低,且易被简单的词语替换所破解而受到批评
为严格遵守欧洲《人工智能法案》的字面规定,OpenAI 现在向 API 客户提供选项,可对特定模型的输出添加水印。此外,该公司计划在几周内,不论用户意愿如何,对欧盟境内符合条件的 ChatGPT 和 Codex 文本输出应用某种形式的数字水印。
但与竞争对手 Anthropic 不同,OpenAI 并未将水印技术应用于欧洲以外地区生成的内容,尽管 API 客户可以选择在任何地方生成的内容上添加标记。此外,OpenAI 使用的技术会漏掉相当一部分 AI 生成文本,且容易被欺骗。
欧盟《人工智能法案》要求生成式 AI 服务提供商以机器可读的方式使模型输出可被识别。
Anthropic 是首家宣布其《人工智能法案》合规方案的主要 AI 公司,该方案涉及应用谷歌的 SynthID-Text 算法,且在全球范围内实施。
微软和 Meta 一直在为基于图像的 AI 开发类似技术,因为欧盟并非唯一对内容来源及利用 AI 生成内容制造虚假信息的潜力表示担忧的市场。OpenAI 已经对 AI 生成的图像、音频和视频应用了其他内容来源信号。
为符合《人工智能法案》的字面规定,OpenAI 现在提供一种名为 textGrain [PDF] 的文本水印方法,该方法 “在模型的选词中添加了不可见的统计信号。我们的检测器会寻找该信号,以评估段落是否包含 OpenAI 水印。”
大型语言模型会从潜在词汇的概率分布中逐个预测词元。通过定期选择不同的词(理想情况下是同义词)进行输出,生成的文本会偏离无偏见模型产生的统计模式。OpenAI 仅向经批准的研究人员和组织提供的水印检测器应能标记这种词汇差异。
这是理论上的设想,但实际结果各异。目标错误率为 1%,但在 200 字的短段落中,检测器可能仅能标记出 80% 的水印,而在 400 字的段落中这一比例为 95%。在数学或代码等功能性文本中,结果更差,因为替换更有可能引入错误。
textGrain 论文并未解决统计上经过调整的选词可能改变给定段落含义的可能性。如果算法改变了某些显著的事实或数据,这种情况就有可能发生。Anthropic 的方法虽然使用不同的算法,但也替换某些输出词,带来类似的风险。
无论如何,OpenAI 的水印很容易通过词语替换被破解。在对 400 个词元段落的测试中,用同义词替换 10% 的词语后,水印检测率从 92% 降至 66%。而当替换 25% 的词语时,仅在 17% 的情况下能检测到水印信号。
现在,请见证这款勉强够用但合规的 AI 检测器的威力…… ®
