Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Forgetting of Memorized Training Examples

Matthew Jagielski, Om Thakkar|arXiv (Cornell University)|Jun 30, 2022
Adversarial Robustness in Machine Learning被引用数 15
ひとこと要約

本稿では、機械学習モデルが時間経過とともに特定の訓練例をどの程度忘れてしまうかを測定する手法を提案している。これは、メンバーシップ推定攻撃を用いてプライバシー漏洩を評価するものである。研究では、確率的勾配降下法で訓練されたモデルが、データのランダム性と非決定性のため、初期の訓練例を忘れることを明らかにした。これは、特に事前学習済みモデルにおいて、初期のデータがメンバーシップ推定攻撃に対して脆弱性が低下するという、受動的なプライバシー上の利点をもたらす。

ABSTRACT

Machine learning models exhibit two seemingly contradictory phenomena: training data memorization, and various forms of forgetting. In memorization, models overfit specific training examples and become susceptible to privacy attacks. In forgetting, examples which appeared early in training are forgotten by the end. In this work, we connect these phenomena. We propose a technique to measure to what extent models "forget" the specifics of training examples, becoming less susceptible to privacy attacks on examples they have not seen recently. We show that, while non-convex models can memorize data forever in the worst-case, standard image, speech, and language models empirically do forget examples over time. We identify nondeterminism as a potential explanation, showing that deterministically trained models do not forget. Our results suggest that examples seen early when training with extremely large datasets - for instance those examples used to pre-train a model - may observe privacy benefits at the expense of examples seen later.

研究の動機と目的

  • 機械学習モデルが、大規模学習やファインチューニングの状況において、特定の訓練例を時間経過とともに忘れているかどうかを調査すること。
  • 忘れが記憶の減少を引き起こし、メンバーシップ推定攻撃によるプライバシーのリスクを軽減するかどうかを特定すること。
  • 訓練順序、データの繰り返し、訓練アルゴリズムの決定性といった要因が、忘れの速度に与える影響を同定すること。
  • 特に確率的勾配降下法の確率性と決定的訓練との違いが、忘れの根本的要因に果たす役割を理解すること。
  • 特に大規模データセットで事前学習されたモデルにおいて、受動的忘れが実用的なプライバシー上の利点をもたらすかどうかを評価すること。

提案手法

  • 特定の訓練例がモデルの学習に使われたかどうかを、最新のメンバーシップ推定攻撃を用いて測定する。
  • 視覚、音声、自然言語処理のタスクでモデルを訓練し、時間経過に伴うメンバーシップ推定の成功確率を測定することで、忘れの度合いを定量化する。
  • 確率的勾配降下法(SGD)で訓練したモデルと、決定的に訓練したモデルを比較することで、非決定性の役割を隔離する。
  • 注入されたデータポイントを含む理論的平均推定タスクを用い、勾配更新における確率性が忘れを引き起こすことを証明する。
  • Rényi発散を用いて、正のデータポイントと負のデータポイントを注入して訓練したモデル間のプライバシー漏洩を境界づける。
  • 制御された訓練実験を用いて、データ順序と重複の影響を忘れの速度に及ぼす影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、特にデータセットの初期に登場する例を、学習中にどの程度忘れてしまうのか?
  • RQ2確率的勾配降下法の確率性が、初期の訓練例を忘れさせることで、記憶の減少とプライバシーリスクの低減をもたらすのか?
  • RQ3決定的訓練と確率的訓練の両者において、例の保持度とメンバーシップ推定攻撃への感受性はどのように異なるのか?
  • RQ4大規模な事前学習における初期例の忘れは、それらの例に対して受動的なプライバシー上の利点をもたらすのか?
  • RQ5データ順序、重複、学習率といった要因の中で、忘れの速度に最も強く影響を与えるのはどれか?

主な発見

  • 確率的勾配降下法で訓練されたモデルは、時間経過とともに初期の訓練例を忘れ、メンバーシップ推定攻撃への感受性が低下する。
  • 決定的に訓練されたモデルでは、忘れが著しく減少または存在しないことが確認され、確率性が忘れの主要因であることが示された。
  • 初期に出現し、繰り返し出現しない例では、忘れの速度が速くなり、特に1エポックまたは少数エポックの学習環境で顕著である。
  • 理論的平均推定タスクにおいて、正のデータポイントと負のデータポイントを注入して訓練したモデル間のRényi発散は、学習ステップが進むにつれて減少し、確率性による忘れが生じることを証明した。
  • 大規模データセットで事前学習されたモデルでは、初期の例が時間経過とともに忘れられることで、受動的なプライバシー上の利点が得られる可能性がある。
  • 非凸なモデル(例:k-means)は非凸性のためプライバシー漏洩を示すが、これはこの文脈でそのような現象が初めて報告された例である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。