Skip to main content
QUICK REVIEW

[论文解读] Watermarking Text Data on Large Language Models for Dataset Copyright

Yixin Liu, Hongsheng Hu|arXiv (Cornell University)|May 22, 2023
Internet Traffic Analysis and Secure E-voting被引用 4
一句话总结

TextMarker 提出了一种基于后门的水印技术,使数据所有者能够通过在少量数据中注入细微触发器,在 NLP 模型训练过程中保护私有文本数据。通过利用对目标模型的黑盒访问,所有者可借助成员推断验证未经授权的使用,实现仅需 0.1% 污染率且对模型性能影响可忽略的版权保护。

ABSTRACT

Substantial research works have shown that deep models, e.g., pre-trained models, on the large corpus can learn universal language representations, which are beneficial for downstream NLP tasks. However, these powerful models are also vulnerable to various privacy attacks, while much sensitive information exists in the training dataset. The attacker can easily steal sensitive information from public models, e.g., individuals' email addresses and phone numbers. In an attempt to address these issues, particularly the unauthorized use of private data, we introduce a novel watermarking technique via a backdoor-based membership inference approach named TextMarker, which can safeguard diverse forms of private information embedded in the training text data. Specifically, TextMarker only requires data owners to mark a small number of samples for data copyright protection under the black-box access assumption to the target model. Through extensive evaluation, we demonstrate the effectiveness of TextMarker on various real-world datasets, e.g., marking only 0.1% of the training dataset is practically sufficient for effective membership inference with negligible effect on model utility. We also discuss potential countermeasures and show that TextMarker is stealthy enough to bypass them.

研究动机与目标

  • 应对在私人文本数据(如个人身份标识符)上训练的 NLP 模型中日益增长的隐私泄露风险。
  • 为个人提供一种实用方法,以验证其私有文本是否被用于未经授权的模型训练。
  • 克服现有成员推断方法需要白盒访问或大量计算资源的局限性。
  • 开发一种隐蔽、可扩展的水印机制,在仅具备黑盒访问权限的情况下运行,并能抵抗模型训练者的检测。

提出的方法

  • 使用在语义上一致且上下文上合理的触发模式,将后门触发器注入一小部分(0.1%)私有文本数据中。
  • 使用标记过的数据训练 NLP 模型,使模型在触发器存在时产生目标标签。
  • 通过向黑盒模型查询嵌入触发器的样本,并将预测置信度与预设阈值进行比较,执行成员推断。
  • 采用隐蔽的触发模式——词级、句级或字符级——以最小化被后门防御机制检测到的可能性。
  • 利用基于嵌入的异常检测(如 all-mpnet-base-v2)评估隐蔽性,通过测量文本与标签嵌入之间的相似度。
  • 优化触发器位置(开头、中间、结尾或随机)以在最大化后门成功率的同时最小化可检测性。

实验结果

研究问题

  • RQ1基于后门的水印方法是否能使数据所有者仅通过黑盒访问验证其私有文本在 NLP 模型训练中被未经授权使用的事实?
  • RQ2TextMarker 在仅使用极低污染率(如 0.1%)的情况下,实现高成员推断准确率的效率如何?
  • RQ3TextMarker 在多大程度上能够规避最先进的后门防御方法?
  • RQ4不同触发模式和位置如何影响水印的成功率与隐蔽性?
  • RQ5固定与随机触发目标选择对成员推断性能和方差的影响如何?

主要发现

  • TextMarker 仅需 0.1% 的污染率即可实现有效的成员推断,表明极少量数据标记已足以实现版权验证。
  • 该方法保持了高模型性能,对多个真实世界数据集的下游分类性能几乎没有下降。
  • TextMarker 有效规避了两种最先进的后门检测方法,检测准确率仅略高于随机猜测(例如 QA-Sim-S 的检测准确率约为 5.5%),表明其具备极强的隐蔽性。
  • 随机触发位置优于固定位置(开头、中间、结尾),可能是因为增加了模糊性并降低了模式可预测性。
  • 句级触发器的后门成功率高于词级或字符级触发器,尽管字符级触发器更具隐蔽性。
  • 固定触发目标可降低攻击成功率的方差,提高成员推断的可靠性,且不牺牲有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。