[论文解读] Watermarking Pre-trained Language Models with Backdooring
该论文提出了一种多任务学习框架,通过在词嵌入层嵌入后门触发器,对预训练语言模型(PLMs)进行水印标记,从而在微调后仍能跨多个下游任务实现鲁棒的所有权验证。该方法实现了超过90%的水印提取成功率,并通过使用常见词组合作为触发器,有效降低了被检测到的风险。
Large pre-trained language models (PLMs) have proven to be a crucial component of modern natural language processing systems. PLMs typically need to be fine-tuned on task-specific downstream datasets, which makes it hard to claim the ownership of PLMs and protect the developer's intellectual property due to the catastrophic forgetting phenomenon. We show that PLMs can be watermarked with a multi-task learning framework by embedding backdoors triggered by specific inputs defined by the owners, and those watermarks are hard to remove even though the watermarked PLMs are fine-tuned on multiple downstream tasks. In addition to using some rare words as triggers, we also show that the combination of common words can be used as backdoor triggers to avoid them being easily detected. Extensive experiments on multiple datasets demonstrate that the embedded watermarks can be robustly extracted with a high success rate and less influenced by the follow-up fine-tuning.
研究动机与目标
- 为解决预训练语言模型(PLMs)在频繁微调至下游任务时面临的知识产权保护挑战。
- 实现在微调过程中因灾难性遗忘而仍有效的持久水印标记。
- 开发一种无需事先了解目标任务的黑盒水印方法,适用于多个下游任务。
- 通过使用常见词组合而非稀有词作为触发器,降低后门触发器的可检测性。
- 确保水印在各种微调超参数(如初始学习率和批量大小)下保持鲁棒性。
提出的方法
- 通过多任务学习框架,在词嵌入层注入后门触发器,将水印嵌入 PLMs。
- 使用稀有词或常见词组合作为后门触发器,以触发特定模型预测(例如,情感分类中的'positive',NLI 任务中的'contradict')。
- 在污染数据集上训练模型,其中干净输入通过插入触发器进行修改,且标签被重新标记为目标类别。
- 应用知识蒸馏(WLM-KD)以提升黑盒设置下水印的鲁棒性和提取准确率。
- 采用频率-概率分析评估触发器的可检测性,结果表明常见词组合比稀有词更难被检测。
- 通过改变微调超参数(学习率、批量大小)来评估水印鲁棒性,并测量水印提取成功率(WESR)和准确率(ACCU)。
实验结果
研究问题
- RQ1后门水印能否以一种在微调后仍对多个下游任务有效的形式嵌入预训练语言模型?
- RQ2当模型在不同数据集上微调时,黑盒设置下的水印提取效果如何?
- RQ3常见词组合能否作为 PLMs 中有效且不可检测的后门触发器?
- RQ4嵌入的水印对学习率和批量大小等微调超参数变化的鲁棒性如何?
- RQ5与稀有词触发器相比,常见词触发器在多大程度上降低了可检测性?
主要发现
- 当模型在 AGNEWS 上微调时,所提出的 WLM 方法在 SST2 数据集上实现了 95.82% 的水印提取成功率(WESR),表现出强大的迁移能力。
- WLM-CW(M) 模型在不同学习率和批量大小下均保持较高的水印鲁棒性,大多数配置下 WESR 均高于 90%。
- 使用常见词组合作为触发器显著降低了可检测性,聚类分析显示此类触发器位于良性词分布内部,而稀有词触发器则表现为异常值。
- 即使将学习率提高至 1e-3,水印仍保持鲁棒,但在该极端设置下出现收敛问题。
- 在 IMDB 上微调的模型 WESR 为 92.00%,低于在 AGNEWS 上的 95.82%,表明模型与目标任务的相似性会影响水印性能,但依然高于 90%。
- 该方法成功实现了在无需事先了解目标任务的情况下,同时为多个下游任务嵌入水印,证明了其广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。