OpenAI将在未来几周内,向欧盟地区受支持版本的ChatGPT和Codex文本回复加入不可见水印。
该公司为回应《欧盟人工智能法案》对以机器可读形式识别生成内容的要求而开发了这项技术。
全球API客户将能够为特定模型自愿启用水印功能,但该功能默认仍将处于关闭状态。
OpenAI表示,编辑、翻译和有限的措辞选择调整可能降低检测率。
OpenAI将在未来几周内,为欧盟地区受支持版本的ChatGPT和Codex文本回复引入不可见水印。随着生成式AI提供商面临欧盟关于以机器可读形式识别生成内容的要求,这项技术旨在帮助判断文本是否由OpenAI系统创建或处理。
OpenAI为回应《欧盟人工智能法案》而推出了这一方法。该功能也将面向全球API客户开放,客户可为特定模型自愿启用水印;该功能默认仍将处于关闭状态。
textGrain如何运作
这套名为textGrain的系统会在模型的用词选择中植入不可见的统计信号。专用检测器随后会分析文本,以判断其是否包含该信号。
OpenAI表示,在其测试中,textGrain的表现与其他方法相当或更好,包括用于文本的SynthID。不过,该公司警告称,实验室结果并不能保证在现实世界条件下具有同样的有效性。
OpenAI称,在1%的假阳性率下,检测器在心理学等主题的约200个词元摘录中检出水印的比例约为80%,在约400个词元摘录中约为95%。数学文本的检测率较低,因为模型在选择词语时的自由度较小。
编辑也显著影响了性能。用同义词替换10%的词语,会使检测率从约92%降至66%;替换25%的词语则会使检测率降至17%。
水印仅提供有限的来源信息
OpenAI表示,水印仅能提供有关文本来源的有限信号。检测结果无法揭示人类对文本贡献了多少、谁拥有或对文本负责、谁使用了OpenAI系统、由哪个提示词或对话生成,也无法表明其中的信息是真实还是虚假。
没有检测到水印也不能证明文本由人类撰写。OpenAI表示,检测可能失败,原因包括段落过短、文本已被编辑或翻译、文本来自不同模型,或文本创作于该技术推出之前。
检测器访问权限将初步受限
OpenAI已面向寻求访问检测器的获批准研究人员和专家机构开放申请。该公司提到假阳性和假阴性结果的风险,并表示将首先以个别方式提供访问权限,以评估该系统的可靠性及其负责任的使用方式。
该公司还计划将textGrain开源,以便其他开发者能利用这项技术构建自己的工具。OpenAI表示,对新型先进Astra模型的测试发现,启用和不启用水印的基准测试结果没有显著差异。
OpenAI表示,没有任何单一方法能够完全验证内容来源。该公司计划继续改进水印检测,包括评估其抵抗编辑和翻译影响的能力,并最终希望能更有效地区分AI辅助写作与完全由AI创作的内容。
另据此前报道,OpenAI正寻求以1.4万亿美元估值融资300亿美元。
来源:HODL Press
