Skip to main content
QUICK REVIEW

[論文レビュー] Memorization in NLP Fine-tuning Methods

Fatemehsadat Mireshghallah, Archit Uniyal|arXiv (Cornell University)|May 25, 2022
Topic Modeling被引用数 11
ひとこと要約

本稿は、NLPの微調整手法における記憶リスクを調査し、メンバーシップインファレンス攻撃およびデータ抽出攻撃を用いて、3つのアプローチ(完全微調整、ヘッドのみ微調整、アダプタ微調整)を評価している。その結果、モデルのヘッドのみを微調整することは、完全微調整やアダプタ微調整と比較して、著しく高い記憶リスクを示すことが判明した。後者2つはプライバシー保護に優れており、プライバシーと性能のトレードオフにおいてパレート最適な領域に位置している。

ABSTRACT

Large language models are shown to present privacy risks through memorization of training data, and several recent works have studied such risks for the pre-training phase. Little attention, however, has been given to the fine-tuning phase and it is not well understood how different fine-tuning methods (such as fine-tuning the full model, the model head, and adapter) compare in terms of memorization risk. This presents increasing concern as the "pre-train and fine-tune" paradigm proliferates. In this paper, we empirically study memorization of fine-tuning methods using membership inference and extraction attacks, and show that their susceptibility to attacks is very different. We observe that fine-tuning the head of the model has the highest susceptibility to attacks, whereas fine-tuning smaller adapters appears to be less vulnerable to known extraction attacks.

研究の動機と目的

  • 異なる微調整手法が大規模言語モデルにおける訓練データの記憶にどのように影響するかを理解すること。
  • 微調整データがしばしば小規模で、標的的かつ機微な性質を有することを踏まえ、微調整に伴うプライバシーリスクを評価すること。
  • 完全モデル微調整、ヘッドのみ微調整、アダプタ微調整の各手法が、メンバーシップインファレンス攻撃およびデータ抽出攻撃に対してどれほど脆弱であるかを比較すること。
  • 実証的証拠を提供し、実務家が用いる微調整戦略のプライバシーと性能のトレードオフについての知見を得ること。

提案手法

  • メンバーシップインファレンス攻撃(MIA)の再現度と、データ抽出リスクの代理指標である露出度の2つの代理指標を用いて、記憶リスクを実証的に評価する。
  • GPT-2を用いて自己回帰的言語モデリングを実行し、Wikipedia、Penn Treebank、Enron Emailsの3つのデータセットで実験を実施する。
  • 完全モデル微調整、ヘッドのみ微調整、および縮小率16および2のアダプタ微調整の3つの微調整手法を比較する。
  • 微調整対象となるパラメータの配置が与える影響を分析するため、GPT-2アーキテクチャの異なるブロック(例:ブロック1–6、7–12、交互に選択)を微調整する。
  • パラメータの束縛に関するアブレーションスタディを実施し、入力埋め込みと言語モデルヘッドのパラメータを束縛するか否かを比較することで、記憶リスクと一般化性能に与える影響を評価する。
  • バリデーションパープレキシティをモデルの有用性の代理指標として用い、プライバシーと性能のトレードオフをプロットすることで、パレート最適な手法を特定する。

実験結果

リサーチクエスチョン

  • RQ1微調整手法の選択が、メンバーシップインファレンス攻撃に対するモデルの脆弱性にどのように影響するか?
  • RQ2完全モデル微調整、ヘッドのみ微調整、アダプタのみ微調整の各場合における相対的な記憶リスクはどの程度か?
  • RQ3トレーニング可能なパラメータのアーキテクチャ的配置(例:初期層 vs. 後続層)が記憶リスクに与える影響は?
  • RQ4入力埋め込みと言語モデルヘッドのパラメータを束縛することで、プライバシーと性能のトレードオフにどのような影響が生じるか?
  • RQ5一般的な実践法よりも優れたプライバシーと性能のトレードオフを達成できる微調整設定は存在するか?

主な発見

  • ヘッドのみ微調整は、メンバーシップインファレンス攻撃の再現度という指標で測定しても、完全微調整を上回る著しい記憶リスクを示した。
  • 完全モデル微調整とアダプタ微調整の両方が、攻撃再現度とバリデーションパープレキシティの両面でパレート最適な領域に位置しており、より優れたプライバシーと性能のトレードオフを示している。
  • 縮小率16および2のアダプタ微調整は、ヘッドのみ微調整と比較して、既知のデータ抽出攻撃に対して低い感受性を示した。
  • GPT-2の最後の6ブロック(7–12)を微調整すると、最初の6ブロック(1–6)を微調整するよりも高い記憶リスクが生じた。これは、後続層が記憶により脆弱である可能性を示唆している。
  • 8番目のブロックを個別に微調整した場合、攻撃再現度が最低で、パープレキシティも最低となり、プライバシーと性能のバランスという観点から最も望ましい単一ブロック微調整設定であった。
  • 入力埋め込みとヘッドパラメータを束縛しない場合、プライバシーと性能のトレードオフが悪化した。これは、パラメータの束縛が一般化性能を向上させ、記憶リスクを低減することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。