[论文解读] Robust Multi-bit Natural Language Watermarking through Invariant Features
本文提出了一种鲁棒的多比特自然语言水印框架,利用不变的语义和句法特征(如关键词和依存结构)嵌入水印,以抵抗常见文本损坏。通过训练一种抗损坏的填空模型,并将水印锚定于这些稳定特征,该方法在四个数据集和多种损坏类型及比例下,相较于先前工作平均提升了16.8个百分点的鲁棒性。
Recent years have witnessed a proliferation of valuable original natural language contents found in subscription-based media outlets, web novel platforms, and outputs of large language models. However, these contents are susceptible to illegal piracy and potential misuse without proper security measures. This calls for a secure watermarking system to guarantee copyright protection through leakage tracing or ownership identification. To effectively combat piracy and protect copyrights, a multi-bit watermarking framework should be able to embed adequate bits of information and extract the watermarks in a robust manner despite possible corruption. In this work, we explore ways to advance both payload and robustness by following a well-known proposition from image watermarking and identify features in natural language that are invariant to minor corruption. Through a systematic analysis of the possible sources of errors, we further propose a corruption-resistant infill model. Our full method improves upon the previous work on robustness by +16.8% point on average on four datasets, three corruption types, and two corruption ratios. Code available at https://github.com/bangawayoo/nlp-watermarking.
研究动机与目标
- 应对订阅媒体、网络小说和大语言模型输出等高价值自然语言内容日益增长的版权保护需求。
- 克服现有水印方法在文本损坏下鲁棒性差或高负载嵌入时质量差的局限性。
- 开发一种在高负载容量与强抗文本损坏能力之间取得平衡,同时保持语义质量的框架。
- 识别并利用文本中在轻微修改下保持稳定的特征(如关键词和句法依存关系),以实现稳定嵌入。
- 设计一种专门针对损坏文本训练的鲁棒填空模型,以在信息提取过程中保持水印完整性。
提出的方法
- 使用现成的NLP模型识别文本中具有感知显著性的不变特征,特别是关键词和句法依存组件。
- 将水印嵌入位置锚定于这些不变特征,以确保在轻微损坏下仍能保持一致且可靠的检测。
- 通过在预训练阶段显式暴露于损坏训练样本,使神经填空模型具备对常见损坏的鲁棒性。
- 采用两阶段水印处理流程:首先将比特嵌入到不变特征中;其次使用鲁棒填空模型重建文本,以保持语言流畅性。
- 利用句子编码器和自然语言推理(NLI)模型指导水印插入顺序,提升语义质量并减少伪影。
- 使用对抗性攻击技术模拟对抗性损坏(如标记替换、删除),以训练填空模型实现真实场景下的鲁棒性。

实验结果
研究问题
- RQ1在自然语言中,哪些语义和句法特征在轻微损坏下足够稳定,可作为水印嵌入的可靠锚点?
- RQ2如何训练神经填空模型,使其在各种类型和程度的文本损坏下仍能保持水印完整性?
- RQ3与随机或启发式嵌入策略相比,将水印锚定于不变特征在多大程度上提升了鲁棒性?
- RQ4在神经水印中,鲁棒性与语义质量之间的权衡如何?这种权衡能否通过架构设计和训练策略缓解?
- RQ5在真实损坏场景下,该方法在不同文本类型和写作风格下的表现如何?
主要发现
- 与先前工作相比,该方法在四个多样化数据集、三种损坏类型和两种损坏比例下,水印提取准确率平均提升了16.8个百分点。
- 使用关键词和依存结构等不变特征作为嵌入锚点,显著增强了鲁棒性,降低了对轻微文本修改的敏感性。
- 抗损坏填空模型在对抗性和随机损坏下均优于标准神经填空模型,能更有效地保持水印完整性。
- 尽管鲁棒性更高,该方法仍通过NLI排序顺序和神经填空模型微调,保持了具有竞争力的语义质量,自动评估指标表现良好。
- 该框架在不同写作风格(包括新闻报道、网络小说和大语言模型生成文本)中表现出强泛化能力。
- 该方法对常见损坏类型(如标记替换和删除)具有鲁棒性,这些损坏类型在训练期间通过对抗性攻击技术进行建模。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。