Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Unintended Memorization in Federated Learning

Om Thakkar, Swaroop Ramaswamy|arXiv (Cornell University)|Jun 12, 2020
Privacy-Preserving Technologies in Data参考文献 23被引用数 20
ひとこと要約

この論文は、フェデレーテッドラーニング(FL)における意図しない記憶化を、シークレットシェイアフレームワークを変更して、FLの各構成要素がどのように機密データの記憶化を軽減するかを測定することによって調査している。ユーザー単位のデータクラスタリング、フェデレーテッドアベレージング(FedAvg)、およびユーザー単位の微分プライバシー(DP)が、記憶化を総合的に低減することが判明しており、特にDPがモデルの有用性を維持したまま、最も強力な保護を提供している。

ABSTRACT

Recent works have shown that generative sequence models (e.g., language models) have a tendency to memorize rare or unique sequences in the training data. Since useful models are often trained on sensitive data, to ensure the privacy of the training data it is critical to identify and mitigate such unintended memorization. Federated Learning (FL) has emerged as a novel framework for large-scale distributed learning tasks. However, it differs in many aspects from the well-studied central learning setting where all the data is stored at the central server. In this paper, we initiate a formal study to understand the effect of different components of canonical FL on unintended memorization in trained models, comparing with the central learning setting. Our results show that several differing components of FL play an important role in reducing unintended memorization. Specifically, we observe that the clustering of data according to users---which happens by design in FL---has a significant effect in reducing such memorization, and using the method of Federated Averaging for training causes a further reduction. We also show that training with a strong user-level differential privacy guarantee results in models that exhibit the least amount of unintended memorization.

研究の動機と目的

  • 中央学習と比較して、フェデレーテッドラーニング(FL)の構成要素が意図しない機密データの記憶化をどのように軽減するかを理解すること。
  • データの非IID性、最適化手法、および微分プライバシー(DP)がFLにおける記憶化に与える影響を評価すること。
  • 修正されたシークレットシェイアフレームワークを用いて、FLモデルの記憶化攻撃に対するレジリエンスを測定すること。
  • DPを有する・なしの異なるFL設定におけるモデルの有用性とプライバシーのトレードオフを比較すること。
  • FLの設計選択の相乗効果が記憶化リスクを軽減するという実証的証拠を提供すること。

提案手法

  • シークレットシェイアフレームワークをFLに適応させるために、ユーザー選択確率 $p_u$ および例の置換確率 $p_e$ の2つのパラメータを導入し、キャニーレをユーザーのデータに埋め込む。
  • 記録レベルおよびバッチレベル分類の2つの評価手法を用いて、モデル出力に記憶されたキャニーレを検出する。
  • フェデレーテッドアベレージング(FedAvg)および確率的勾配降下法(SGD)を用いてモデルを学習し、IIDおよびNon-IIDなデータ分割における記憶化を比較する。
  • モデル集約時にノイズを注入することで、ユーザー単位の微分プライバシー(DP)を適用し、形式的なプライバシー保証を達成する。
  • パープレキシティを用いてモデルの有用性を測定し、埋め込んだキャニーレの検出率を用いて記憶化を評価する。
  • ミニバッチサイズ、ユーザーのデータ分布、DPパラメータの変動を想定した実験を実施し、各要因の影響を分離する。

実験結果

リサーチクエスチョン

  • RQ1FLにおけるユーザー単位のデータクラスタリングは、中央学習と比較して意図しない記憶化にどのように影響するか?
  • RQ2SGDと比較して、フェデレーテッドアベレージングを用いることで、FLにおける記憶化にどのような影響があるか?
  • RQ3ユーザー単位の微分プライバシーを適用することで、FLモデルにおける記憶化はどの程度軽減されるか?
  • RQ4異なる学習設定におけるモデルの有用性と記憶化のトレードオフは、どのように変化するか?
  • RQ5明示的なDPがなくても、FLの固有の設計的特徴が相乗的に記憶化を低減できるか?

主な発見

  • ユーザー単位のデータクラスタリングは、追加のプライバシー機構がなくても、意図しない記憶化を顕著に低減する。
  • SGDからフェデレーテッドアベレージングに切り替えることで、記憶化がさらに低減され、特に有効なミニバッチサイズが大きい場合に顕著である。
  • ユーザー単位のDPを用いて学習したモデルは、記憶化が最小限に抑えられ、100エポック後にはキャニーレの検出が認められず、$(18.8, 10^{-7})$-DPを達成している。
  • Non-IIDな設定下でも、DP-FedAvgモデルは10エポックの学習でキャニーレの記憶化を示さず、非DPベースラインを上回った。
  • 最も低いキャニーレ設定下でも、シークレットシェア手法はDP-FedAvgモデルでキャニーレを検出しなかったことから、強いレジリエンスが示された。
  • すべての設定において、モデルの有用性は同等であり、DP-FedAvgを含む、プライバシーとパフォーマンスが相反しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。