[论文解读] A Watermark for Large Language Models
该论文提出一个对LLM输出的概率性水印框架,该水印可以从短文本片段中检测到,无需模型访问,使用绿/红标记方案和统计测试,并分析其鲁棒性及对文本质量的影响。
Potential harms of large language models can be mitigated by watermarking model output, i.e., embedding signals into generated text that are invisible to humans but algorithmically detectable from a short span of tokens. We propose a watermarking framework for proprietary language models. The watermark can be embedded with negligible impact on text quality, and can be detected using an efficient open-source algorithm without access to the language model API or parameters. The watermark works by selecting a randomized set of "green" tokens before a word is generated, and then softly promoting use of green tokens during sampling. We propose a statistical test for detecting the watermark with interpretable p-values, and derive an information-theoretic framework for analyzing the sensitivity of the watermark. We test the watermark using a multi-billion parameter model from the Open Pretrained Transformer (OPT) family, and discuss robustness and security.
研究动机与目标
- 动机:未标记的AI生成文本可能带来的危害,以及对可审计检测的需求。
- 引入一个不需要模型访问或重新训练的水印框架。
- 开发具有可解释p值的统计检测方法,用于水印的存在性。
- 分析水印的信息理论敏感性及其对攻击的鲁棒性。
提出的方法
- 定义一个绿/红标记分区,并采用硬(水印规则(算法1))或软(水印规则(算法2))规则。
- 用先前令牌的哈希值对分区进行播种,以在没有模型访问的情况下复现该规则。
- 修改采样分布,使绿令牌偏好更高(软)或禁止红令牌(硬)。
- 使用文本片段中绿令牌计数的一元z检验来检测水印(H0:无水印)。
- 使用伪随机函数(PRFs)提供私有水印变体以隐藏规则,并讨论抗攻击性和API注意事项。
- 理论分析通过尖点熵和推导界限将水印参数与检测能力联系起来(定理4.2、4.3)。
实验结果
研究问题
- RQ1在不重新训练或访问模型的情况下,水印是否可以嵌入在LLM输出中,并且仍然能够被第三方可靠检测?
- RQ2在不同解码策略(多项式、贪婪、束搜索)下,水印的检测能力和误报率是多少?
- RQ3文本熵如何影响水印检测灵敏度和样本效率?
- RQ4水印对对令牌的对抗性修改以及对私钥(API)实现的鲁棒性如何?
主要发现
- 一个简单的硬红名单水印可以用单比例z检验在最少16个令牌时检测到,且当z>4时假阳性率约为3e-5。
- 软水印在高熵区域将概率朝向绿色令牌集提升,对困惑度的影响有限,且检测灵敏度随文本熵增加而提高。
- 在OPT-1.3B/OPT-2.7B的实验显示高检测率:例如,在z>4下,多项式与束搜索解码的经验灵敏度为98.4-99.6%。
- 该框架在无模型访问的情况下维持检测,支持公开或私有部署,并对某些攻击策略保持鲁棒,同时也强调在低熵、记忆化文本场景下的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。