Skip to main content
QUICK REVIEW

[论文解读] Memorization in NLP Fine-tuning Methods

Fatemehsadat Mireshghallah, Archit Uniyal|arXiv (Cornell University)|May 25, 2022
Topic Modeling被引用 11
一句话总结

本文研究了NLP微调方法中的记忆风险,采用成员身份推断攻击和数据提取攻击评估三种方法:完整微调、仅头部微调和适配器微调。结果表明,仅微调模型头部会导致显著更高的记忆化程度,相比完整微调或适配器微调,后者在隐私-效用权衡中表现更优,处于帕累托最优前沿。

ABSTRACT

Large language models are shown to present privacy risks through memorization of training data, and several recent works have studied such risks for the pre-training phase. Little attention, however, has been given to the fine-tuning phase and it is not well understood how different fine-tuning methods (such as fine-tuning the full model, the model head, and adapter) compare in terms of memorization risk. This presents increasing concern as the "pre-train and fine-tune" paradigm proliferates. In this paper, we empirically study memorization of fine-tuning methods using membership inference and extraction attacks, and show that their susceptibility to attacks is very different. We observe that fine-tuning the head of the model has the highest susceptibility to attacks, whereas fine-tuning smaller adapters appears to be less vulnerable to known extraction attacks.

研究动机与目标

  • 理解不同微调方法如何影响大语言模型对训练数据的记忆化程度。
  • 评估微调相关的隐私风险,特别是考虑到微调数据通常规模小、目标明确且高度敏感。
  • 比较不同微调方法(完整模型、仅头部、适配器微调)对成员身份推断攻击和数据提取攻击的敏感性。
  • 为从业者提供不同微调策略在隐私-效用权衡方面的实证证据。

提出的方法

  • 使用两种代理指标实证评估记忆化程度:成员身份推断攻击(MIA)召回率和曝光度(数据提取风险的代理指标)。
  • 在三个数据集上进行实验:Wikipedia、Penn Treebank和Enron Emails,使用GPT-2进行自回归语言建模。
  • 比较三种微调方法:完整模型微调、仅头部微调和适配器微调(压缩因子分别为16和2)。
  • 通过微调GPT-2架构的不同模块(如第1–6层、第7–12层、每隔一层)分析参数位置的影响。
  • 对参数共享进行消融研究,比较共享与非共享的嵌入和头部参数,以评估其对记忆化和泛化的影响。
  • 使用验证困惑度作为模型效用的代理指标,并绘制隐私-效用权衡图,以识别帕累托最优方法。

实验结果

研究问题

  • RQ1微调方法的选择如何影响模型对成员身份推断攻击的敏感性?
  • RQ2微调完整模型、仅头部或仅适配器的相对记忆化风险是什么?
  • RQ3可训练参数的架构位置(如早期层与晚期层)是否会影响记忆化程度?
  • RQ4输入嵌入与语言模型头部之间的参数共享如何影响隐私-效用权衡?
  • RQ5是否存在比常用实践更优的微调配置,能在隐私-效用权衡上表现更佳?

主要发现

  • 仅微调模型头部在成员身份推断攻击召回率上表现出最高的记忆化程度,甚至超过完整微调。
  • 完整模型微调和适配器微调在攻击召回率与验证困惑度之间均位于帕累托前沿,表明其隐私-效用权衡更优。
  • 压缩因子为16和2的适配器微调相比仅头部微调,对已知数据提取攻击的敏感性更低。
  • 微调GPT-2的最后六层(第7–12层)比微调前六层(第1–6层)导致更高的记忆化程度,表明深层更易发生记忆化。
  • 单独微调第8层时,攻击召回率最低且困惑度最低,是隐私-效用平衡方面最理想的单一层块微调选择。
  • 解除输入嵌入与头部参数的共享会恶化隐私-效用权衡,表明参数共享有助于提升泛化能力并减少记忆化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。