Today for AI

OpenAI 官方博客 · 2026/10/5 15:00:00

OpenAI 公布欧盟文本水印合规方案

原标题:Our approach to EU text provenance rules
42AI 研判分
核心综述

OpenAI 宣布针对《欧盟人工智能法案》的文本水印分阶段实施策略,旨在满足机器可读标识要求。目前全球 API 用户可自愿开启特定模型的水印功能,未来数周将在欧盟地区的 ChatGPT 和 Codex 输出中默认添加隐形水印。鉴于文本水印技术尚处早期且存在局限,OpenAI 强调透明度并计划逐步扩展检测器访问权限。

报道全文原始报道全文

本文目录5 个章节

内容溯源 旨在帮助人们了解内容的来源、创作或编辑方式,以及其中是否包含与我们模型相关的信号。此前,我们已公开提供用于识别由我们模型生成的图像和音频的工具。今天,为响应《欧盟人工智能法案》(EU AI Act),我们分享了文本水印技术的方案及其在更广泛工作中的定位。

《欧盟人工智能法案》要求生成式 AI 提供商以机器可读的方式使生成的文本具备可识别性。文本水印与检测技术仍处于早期阶段,存在显著局限性,业界对其益处及负责任使用的看法也在不断演变。我们的分阶段方法既遵循了《欧盟人工智能法案》的要求,也充分考虑了该技术的局限性,并着重强调透明度,明确告知公众文本水印能做什么以及不能做什么:

  • 即日起,全球 API 客户可选择针对特定模型启用文本水印功能。在 API 中,文本水印默认保持关闭状态。

  • 在未来几周内,我们将为欧盟境内符合条件的 ChatGPT 和 Codex 文本输出添加隐形水印。

  • 我们开放申请以访问我们的文本水印检测器。初期访问权限将仅限于经批准的研究人员和专家组织,他们有助于我们评估和改进该技术。

  • 上述措施仅适用于文本溯源——我们针对音频和图像的验证工具,包括 openai.com/verify⁠ 网页工具和 Content Provenance API⁠(opens in a new window),将继续向希望了解图像或音频文件是否由我们系统生成的组织公开可用。

我们的水印技术工作原理及性能表现

我们的文本水印技术 textGrain 会在模型的词汇选择中添加一种不可见的统计信号。我们的检测器通过寻找该信号来评估一段文本是否包含 OpenAI 水印。有关 textGrain 工作原理的更多细节,请参阅我们的 技术报告⁠(opens in a new window),该报告将在未来几周内更新以补充更多细节。我们还计划将该技术开源,以便其他人可以在此基础上进行开发。

在我们的评估中,textGrain 的表现与包括 SynthID for text 在内的其他测试方法相当甚至更优。尽管如此,理想条件下的强劲表现并不能保证日常使用中的可靠检测。

检测器可能出现两类错误:在没有水印的情况下报告存在水印——即误报(false positive);或者未能检测到实际存在的水印——即漏报(false negative)。以下评估揭示了部分挑战:

  • 较短或约束较多的文本更难检测。 在 1% 的目标误报率下,我们的检测器在约 80% 的 200 token 段落中识别出了水印,而在 400 token 的段落中这一比例约为 95%,以心理学类内容为例。对于数学等词汇选择灵活性较低的内容,检测率显著更低。

  • 编辑会削弱水印。 在一项针对 400 token 段落的评估中,将 10% 的单词替换为同义词使检测率从约 92% 降至 66%。替换 25% 的单词则使其进一步降至 17%。

这些局限性促使我们决定仅向经批准的研究人员和专家组织提供初步的检测器访问权限,他们可以帮助我们评估其可靠性及负责任的使用方式。

该图表展示了在 ELI5 数据集⁠(opens in a new window) 中,针对数学和心理学问题的带水印回复在 1% 目标误报率下的检测结果。随着文本长度增加,检测效果有所提升,但对于词汇选择灵活性较低的内容(如数学),整体检测率仍显著偏低。

编辑操作会大幅削弱水印信号。此图表展示了替换段落中 10% 或 25% 的单词对检测效果的影响。结果基于对 ELI5⁠(opens in a new window) 问题生成的带水印英文回复。

水印对输出质量的影响

在我们用于评估最新前沿模型 Astra 的各项基准测试中,未发现添加水印与否之间存在有意义的性能差异。

基准测试无水印文本(Astra,最大)有水印文本(Astra,最大)
Artificial Analysis 智能指数49.57 分49.76 分
AutomationBench34.09%34.86%
DeepSWE v1.172.80%71.68%
Terminal-Bench 4.053.90%56.06%
Terminal-Bench Science 0.156.90%60.00%
BrowseComp87.92%87.35%
HealthBench Professional64.27%64.60%
GPQA Diamond94.44%93.94%

文本水印无法传达的信息

文本水印仅能提供关于我们的系统在一段文本中所起作用的有限信号。理解检测结果能得出什么结论、不能得出什么结论至关重要。

  • 水印不衡量人类的贡献。 它可以表明 OpenAI 的系统生成或处理了部分文本,但无法反映其中包含了多少人类判断、编辑或创意。

  • 水印不确立所有权或责任归属。 它无法确定文本的所有者是谁、其使用是否合法、是否需要披露信息,以及谁应对此负责。

  • 水印不识别用户身份。 它不会将特定个人、组织、账户、提示词或对话与文本关联起来。

  • 水印不验证准确性。 它无法告诉你一段文本是否真实、是否具有误导性、是否有害,或者是否在正确的语境下呈现。

  • 未检测到水印并不证明是人类创作。 使用 OpenAI 工具生成的文本可能因过短、经过编辑或被翻译而导致检测不可靠。此外,文本也可能来自不支持水印的模型、在水印功能推出之前生成,或由其他公司的工具生成。

我们的下一步计划

  • 在欧盟推出文本水印功能。 在未来几周内,我们将仅在欧盟地区向所有套餐中符合条件的 ChatGPT 和 Codex 用户引入文本水印功能。我们并未在发布时将文本水印设为全球默认选项。这种区域性策略为我们提供了从实际使用和反馈中学习空间。

  • 为 API 客户启用可选的水印功能。 从今天起,全球的 API 客户可以选择针对特定模型启用带水印的文本输出。这使客户能够根据自身的透明度义务及提供给用户的体验来决定如何应用水印功能。此外,我们正在与云合作伙伴合作,计划在未来几周内通过他们的服务提供对 OpenAI 模型输出的水印支持。

  • 向研究人员和专业机构开放检测器访问权限。 获批的研究人员和专业机构即日起可提交申请。根据《AI 生成内容行为准则⁠(在新窗口中打开)》(Code of Practice),我们将最初基于个案审批的方式授予访问权限,以支持文本来源溯源的评估与改进。该工具将报告是否检测到 OpenAI 水印,但不会识别用户身份,也不会泄露其提示词或对话内容。鉴于存在漏检和误报的风险,我们在发布初期暂不向公众开放此功能。

随着技术、标准和证据的不断演进,我们预计会对这一方法的各个部分进行重新审视。

我们在内容来源溯源方面的整体策略

没有任何单一的来源溯源技术足以独立应对所有挑战,因此我们采用分层方法,结合开放标准、持久化水印技术和验证工具。

我们在支持的图像输出中添加 Content Credentials(内容凭证),符合 C2PA 规范⁠(在新窗口中打开),在支持的图像和音频中嵌入不可见的 SynthID⁠(在新窗口中打开) 水印,并通过 openai.com/verify⁠ 和我们的 Content Provenance API⁠(在新窗口中打开) 提供图像和音频验证服务。这些技术相辅相成:Content Credentials 可以记录文件的来源和历史,而不可见水印则能在元数据被移除时保留信号。

正如我们在选举保障措施工作中所述,来源溯源可以帮助个人和平台评估可能具有误导性的 AI 生成内容,包括深度伪造(deepfakes)。我们将这些信号与政策、滥用检测、举报机制、调查及执法行动相结合,并与研究人员、标准组织、平台和民间社会合作,使来源溯源在整个更广泛的生态系统中发挥效用。

[注:本文篇幅超长,以上为核心前篇精译,后续内容保留原文呈现]

Extending provenance to text requires accounting for how easily it can be rewritten, translated, or edited. As we discussed inJune, our approach must reflect the practical limits of current technology. We’ll continue improving detection, studying how watermarks withstand editing and translation, and exploring ways to distinguish AI assistance from AI authorship more meaningfully. We’ll adapt our approach as evidence, standards, and regulatory requirements evolve, and expand detector access when we believe results can be interpreted responsibly.

For more information, please visit our

help center article⁠(opens in a new window) .