Skip to main content
QUICK REVIEW

[論文レビュー] Sharing Models or Coresets: A Study based on Membership Inference Attack

Hanlin Lu, Changchang Liu|arXiv (Cornell University)|Jul 6, 2020
Privacy-Preserving Technologies in Data参考文献 17被引用数 9
ひとこと要約

本稿は、モデルの精度、通信コスト、およびメンバー推定攻撃(MIA)による機微情報漏洩の観点から、フェデレーテッドラーニングとコアセットベースのラーニングを比較する。本稿では、コアセットベースのラーニングに対する最初のMIAを提案し、完全な精度で運用する場合、フェデレーテッドラーニングが優れたプライバシー保護を提供する一方、精度に多少の損失を許容できる場合、コアセット共有は顕著に低い通信コストと低いプライバシー漏洩で同等の精度を達成できることを発見した。

ABSTRACT

Distributed machine learning generally aims at training a global model based on distributed data without collecting all the data to a centralized location, where two different approaches have been proposed: collecting and aggregating local models (federated learning) and collecting and training over representative data summaries (coreset). While each approach preserves data privacy to some extent thanks to not sharing the raw data, the exact extent of protection is unclear under sophisticated attacks that try to infer the raw data from the shared information. We present the first comparison between the two approaches in terms of target model accuracy, communication cost, and data privacy, where the last is measured by the accuracy of a state-of-the-art attack strategy called the membership inference attack. Our experiments quantify the accuracy-privacy-cost tradeoff of each approach, and reveal a nontrivial comparison that can be used to guide the design of model training processes.

研究の動機と目的

  • モデルの精度、通信コスト、およびデータプライバシーの観点から、フェデレーテッドラーニングとコアセットベースのラーニングを体系的に比較すること。
  • 最先端の攻撃手法としてのメンバー推定攻撃(MIA)を用いて、コアセットベースのラーニングのプライバシー漏洩を評価すること。
  • 分散機械学習における精度、通信コスト、プライバシー漏洩のトレードオフを定量的に評価すること。
  • 異なる精度およびプライバシー制約下での各アプローチの優劣を特定することで、分散学習の設計意思決定を支援すること。

提案手法

  • コアセットベースのラーニングに特化した新しいメンバー推定攻撃(MIA)を提案し、モデルの出力とトレーニングエポックからの勾配を入力特徴として用いる。
  • シャロウモデルベースのMIAフレームワークを採用し、フェデレーテッドラーニングおよびコアセットトレーニングプロセスの両方における中間的モデル状態を用いて攻撃モデルを訓練する。
  • 実世界のデータセット(LocationsおよびPurchase100)を用いて、制御された環境下でモデル性能、通信コスト、およびMIAの精度を評価する。
  • フェデレーテッドラーニングでは、100エポック(完全な精度)と30エポック(部分的精度)でモデルをトレーニングする。コアセットでは、目標精度に一致するよう、さまざまなサイズのコアセットを構築する。
  • MIA攻撃精度を用いてプライバシー漏洩を測定する——値が高いほどメンバー推定のリスクが高くなる。
  • 構造的影響を評価するため、階層型および連結型の2つのデータ集約アーキテクチャを用いて両アプローチを比較する。

実験結果

リサーチクエスチョン

  • RQ1同じ目標精度下で、コアセットベースのラーニングのプライバシー漏洩はフェデレーテッドラーニングに比べてどの程度か?
  • RQ2フェデレーテッドラーニングとコアセットベースのラーニングにおいて、通信コスト、モデル精度、プライバシー漏洩のトレードオフはどのように変化するか?
  • RQ3モデル精度が同等の場合、コアセットの共有はフェデレーテッドラーニングにおけるモデル更新の共有よりも優れたプライバシー保護を提供するか?
  • RQ4どの程度の精度要件がある場合に、コアセットベースのラーニングがプライバシーおよび通信コストの観点でフェデレーテッドラーニングを上回るか?
  • RQ5異なるデータ集約アーキテクチャは、コアセットおよびフェデレーテッドラーニングシステムに対するメンバー推定攻撃の有効性にどのように影響するか?

主な発見

  • 完全な精度(83.4%)の状況では、フェデレーテッドラーニングが通信コストが高めでも、より優れたプライバシー保護を提供する(MIA精度:72.0%)一方、コアセットではMIA精度が100%に達する。
  • 精度を約79.8%に低下させた場合、コアセットベースのラーニングは顕著に低い通信コスト(9.0M vs. 526.9M)と低いプライバシー漏洩(MIA精度:51.0% vs. 59.8%)を実現し、同等のモデル性能を達成する。
  • 15,000サンプルのコアセットでは、テスト精度78.4%、MIA精度51%を達成し、30エポックのフェデレーテッドラーニングをプライバシーおよびコストの観点で上回る。
  • 階層型アーキテクチャ下では、目標モデルが約79%の精度に達した場合、コアセットベースのラーニングがMIA精度を51%まで低下させ、プライバシー漏洩の緩和が有効に機能することが示された。
  • 連結型アーキテクチャでは、コアセットのMIA攻撃モデルが50%の精度に達したが、これはアーキテクチャ設計が攻撃成功に影響を与えることを示唆する。しかし、依然として通信効率性においてフェデレーテッドラーニングを上回る。
  • 結果から、フェデレーテッドラーニングにおける勾配がメンバー情報を露呈するのに対し、コアセットは露呈しないことが明らかになった。これは、フェデレーテッドラーニングがプライバシー保護を意図しているにもかかわらず、MIAに対してより脆弱である理由を説明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。