OpenAI 今日宣布将如何遵从欧盟人工智能法案,该法案要求生成性人工智能系统的提供者以可识别的方式标记人工智能生成的文本。以下是具体细节。
背景方面,几个月前,Anthropic 引发争议,宣布为了遵从欧盟人工智能法案,Claude 将开始通过稍微调整其用词来水印文本。简而言之,Claude 有时会根据一个隐藏的模式在意义相近的词之间进行选择,Anthropic 表示这对其回应的意义、质量或可读性没有实质影响。Anthropic 亦开发了一个检测器,可以寻找文本中的该模式,并判断该文本是否可能来自 Claude。
该检测器无法用于判断文本是否来自 OpenAI 或其他竞争对手,因为 Claude 的水印是使用专属于 Anthropic 系统的秘密钥匙生成的。
在争议的高峰期,Anthropic 强调 Claude 并非孤单一个,指出其他几家主要的人工智能提供者亦在实施标记系统以遵循欧盟的要求。今日,OpenAI 宣布其自身的解决方案,虽然使用了类似的方法,但推出范围和规模相对有限。
OpenAI 将于未来几周内为 ChatGPT 和 Codex 添加水印
根据 OpenAI 的说法,“全球的 API 客户将可以选择为选定模型启用文本水印”,而该公司“将在未来几周内为符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印”,这意味着目前 API 中的文本水印默认仍为关闭,至于 ChatGPT 和 Codex,最初将仅限于欧盟的符合条件用户。
OpenAI 亦开放申请其文本水印检测器的访问权限,初期将限于获批的研究人员和专业机构,随着公司对该技术进行评估和改进。关于准确性,OpenAI 明确表示,检测技术仍存在显著的局限性,可能会产生假阴性和假阳性,特别是在较短文本或特定领域的内容中,“例如数学,因为用词选择的弹性较小。”
OpenAI 提到其文本水印技术 textGrain,该技术为模型的用词添加了一个不可见的统计信号。检测器寻找该信号,以评估一段文本是否包含 OpenAI 的水印。关于 textGrain 的工作原理,更多的细节可以在我们的技术报告中找到,该报告将在未来几周内更新更多细节。我们也计划将该技术开源,以便其他人能够基于此进行开发。
该公司还指出,除了在较短段落中更难检测外,编辑亦可显著削弱水印:在对 400 个标记的段落进行评估时,用同义词替换 10% 的单词,检测率从约 92% 降至 66%。而用 25% 的单词替换后,检测率降至 17%。有趣的是,OpenAI 对水印和未水印文本的比较显示,水印输出在几个基准测试中实际上得分稍高,尽管该公司表示未发现整体性能有意义的差异。
基准 未水印文本 (Astra, max) 水印文本 (Astra, max) 人工分析智能指数 49.57 分 49.76 分 自动化基准 34.09% 34.86% DeepSWE v1.1 72.80% 71.68% 终端基准 4.0 53.90% 56.06% 终端基准科学 0.1 56.90% 60.00% BrowseComp 87.92% 87.35% HealthBench 专业 64.27% 64.60% GPQA Diamond 94.44% 93.94%
OpenAI 亦强调,除了假阳性和假阴性的不足外,水印“并不测量人类贡献”,“并不确立所有权或责任”,“并不识别用户”,且“并不验证准确性”。OpenAI 补充说,“未检测到水印的情况并不证明是人类创作。”最后,该公司表示,随着技术、标准和证据的演变,它预计会重新审视其方法,同时继续研究水印在编辑和翻译中能否更好地存活,以及是否能更有意义地区分人工智能辅助和人工智能创作。
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

