Skip to main content
QUICK REVIEW

[论文解读] Protecting Your NLG Models with Semantic and Robust Watermarks

Tao Xiang, Chunlong Xie|arXiv (Cornell University)|Dec 10, 2021
Adversarial Robustness in Machine Learning被引用 6
一句话总结

本文提出了一种用于自然语言生成(NLG)模型的黑盒水印方案,利用语义一致且无害的短语对作为水印。通过采用一种引导模型注意力的语义组合模式嵌入水印,该方法在不破坏模型性能的前提下,实现了对微调、迁移学习和模型压缩的高鲁棒性,同时可规避最先进后门检测算法的检测。

ABSTRACT

Natural language generation (NLG) applications have gained great popularity due to the powerful deep learning techniques and large training corpus. The deployed NLG models may be stolen or used without authorization, while watermarking has become a useful tool to protect Intellectual Property (IP) of deep models. However, existing watermarking technologies using backdoors are easily detected or harmful for NLG applications. In this paper, we propose a semantic and robust watermarking scheme for NLG models that utilize unharmful phrase pairs as watermarks for IP protection. The watermarks give NLG models personal preference for some special phrase combinations. Specifically, we generate watermarks by following a semantic combination pattern and systematically augment the watermark corpus to enhance the robustness. Then, we embed these watermarks into an NLG model without misleading its original attention mechanism. We conduct extensive experiments and the results demonstrate the effectiveness, robustness, and undetectability of the proposed scheme.

研究动机与目标

  • 解决NLG模型缺乏有效、非侵入性水印技术的问题,避免干扰模型行为。
  • 设计语义连贯且与正常文本难以区分的水印,以防止被检测。
  • 确保水印在模型经过微调、迁移学习和压缩等修改后仍可验证。
  • 开发一种可抵抗现有后门检测算法检测的水印方法。

提出的方法

  • 该方法引入了一种语义组合模式(SCP),通过将前缀短语与关键词语配对,引导模型注意力聚焦于特定的、语义上有意义的输出。
  • 水印样本通过遵循SCP生成,以确保语义连贯性,并最小化对注意力机制的干扰。
  • 水印语料库经过系统性增强,以提高对模型修改和数据分布变化的鲁棒性。
  • 水印在训练过程中嵌入,不改变模型原始的注意力模式或在标准任务上的性能。
  • 该方法采用黑盒水印技术,仅需输入输出对即可验证,无需访问模型参数。
  • 可检测性通过在三种后门检测算法(ONION、编辑距离、BERTScore)上测试,并以AUC为评估指标进行评估。

实验结果

研究问题

  • RQ1能否设计一种NLG模型水印方案,使其语义连贯且可规避现有检测方法?
  • RQ2水印对微调和迁移学习等常见模型修改的鲁棒性如何?
  • RQ3该水印方案在标准NLP任务上对原始模型性能的保持程度如何?
  • RQ4在模型压缩或参数更新后,水印是否仍可可靠验证?

主要发现

  • 在IWSLT14数据集上,经过迁移学习后,水印方案的BLEU分数仍保持在28.59,表明模型性能得到良好保留。
  • 在IWSLT14和OpenSubtitles12数据集上,迁移学习后水印提取成功率(WESR)分别达到0.96和0.79,表明水印具有高可验证性。
  • 在WMT17翻译基准上,三种检测算法(ONION、编辑距离、BERTScore)的AUC值分别为0.0287、0.0179和0.0280,表明检测性能接近随机水平。
  • 在对话生成任务中,检测算法的AUC值分别为0.4156(ONION)、0.5715(编辑距离)和0.2319(BERTScore),表明水印无法被可靠检测。
  • 即使使用高达100%的训练数据进行微调,水印仍可验证,证明其具有极强的鲁棒性。
  • 水印在语义上与正常文本难以区分,这由其低可检测性以及在多样化语料库中的一致表现所证实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。