[论文解读] A Semantic Invariant Robust Watermark for Large Language Models
该论文提出了一种用于大语言模型的语义不变水印方法,通过专用的水印模型基于前序标记的语义嵌入生成水印logits。该方法利用基于BERT的编码器和经过训练的变换网络,结合相似性损失与归一化损失,在同义词替换和改写攻击下实现了高鲁棒性,同时保持了强大的安全性,解决了长期存在的鲁棒性类型之间的权衡问题。
Watermark algorithms for large language models (LLMs) have achieved extremely high accuracy in detecting text generated by LLMs. Such algorithms typically involve adding extra watermark logits to the LLM's logits at each generation step. However, prior algorithms face a trade-off between attack robustness and security robustness. This is because the watermark logits for a token are determined by a certain number of preceding tokens; a small number leads to low security robustness, while a large number results in insufficient attack robustness. In this work, we propose a semantic invariant watermarking method for LLMs that provides both attack robustness and security robustness. The watermark logits in our work are determined by the semantics of all preceding tokens. Specifically, we utilize another embedding LLM to generate semantic embeddings for all preceding tokens, and then these semantic embeddings are transformed into the watermark logits through our trained watermark model. Subsequent analyses and experiments demonstrated the attack robustness of our method in semantically invariant settings: synonym substitution and text paraphrasing settings. Finally, we also show that our watermark possesses adequate security robustness. Our code and data are available at \href{https://github.com/THU-BPM/Robust_Watermark}{https://github.com/THU-BPM/Robust\_Watermark}. Additionally, our algorithm could also be accessed through MarkLLM \citep{pan2024markllm} \footnote{https://github.com/THU-BPM/MarkLLM}.
研究动机与目标
- 解决大语言模型水印中攻击鲁棒性与安全性鲁棒性之间的固有权衡问题。
- 开发一种在语义不变的文本修改(如改写和同义词替换)下仍有效的水印方法。
- 确保水印logits具有多样性、无偏见,并能抵抗基于频率的破解攻击。
- 通过并行计算水印和语言模型logits,将文本生成过程中的延迟影响降至最低。
- 在保持文本质量的前提下实现高检测准确率,以困惑度作为衡量指标。
提出的方法
- 该方法使用独立的嵌入语言模型(例如 Compositional-BERT)从先前标记中提取语义嵌入。
- 一个可训练的水印模型通过一个四层前馈网络将这些语义嵌入转换为水印logits。
- 水印模型通过两个目标进行训练:相似性损失以保留水印logits中的语义相似性,归一化损失以确保logits分布均衡、呈双峰分布且以零为中心。
- 使用tanh函数对水印logits进行缩放,使其值接近±1,从而最小化偏差并最大化多样性。
- 在生成过程中,水印logits与语言模型logits并行计算,仅带来极小的延迟开销。
- 水印检测通过平均所有标记的水印logits完成;若平均值显著为正,则表明存在水印。

实验结果
研究问题
- RQ1水印方法是否能在同义词替换和改写等语义不变的文本扰动下保持鲁棒性?
- RQ2水印方案能否同时实现高攻击鲁棒性和强安全性鲁棒性,从而克服传统权衡?
- RQ3如何生成对语义变化保持不变但对文本结构模式敏感的水印logits?
- RQ4该水印方法在多大程度上影响了文本质量,以困惑度衡量?
- RQ5水印过程能否高效并行化,以最小化推理延迟?
主要发现
- 所提方法在同义词替换和改写攻击下的攻击鲁棒性与KGW-1(全局水印logits)相当,接近基于水印logits方法的理论上限。
- 在欺骗攻击中,该方法展现出强大的安全性鲁棒性,攻击者尝试提取水印时的解密准确率较低,优于先前方法。
- 水印模型在输入嵌入相似性与输出水印logits相似性之间保持了较强的关联性,尤其在语义高度相似的输入(相似度 > 0.8)下表现更佳。
- 文本质量受影响极小,困惑度仅略有上升——略低于KGW系列方法,表明其语言流畅性与一致性更优。
- 该方法仅带来微小的延迟增加,在未并行化时,LLaMA-7B的延迟增加约40%;当水印与语言模型logits并行计算时,生成速度几乎无差异。
- 归一化损失有效防止了极端logit值的出现,确保了对称且无偏的标记选择,从而增强了安全性和多样性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。