Skip to main content
QUICK REVIEW

[論文レビュー] Differentially private cross-silo federated learning

Mikko Heikkilä, Antti Koskela|arXiv (Cornell University)|Jul 10, 2020
Privacy-Preserving Technologies in Data参考文献 40被引用数 22
ひとこと要約

本稿では、加法的準同型暗号による安全な合算と分散サブサンプリングを用いて、複雑なモデル(深層ニューラルネットワークなど)を訓練する際の強いプライバシー保証を実現する、差分プライバシーを適用したクロスシロ分散型フェデレーテッドラーニングを提案する。最適化された暗号プロトコルとランダムプロジェクションを用いることで、通信効率を高め、スケールが大きくても非分散環境と同等の精度を達成しつつ、実行時間も合理的な水準を維持する。

ABSTRACT

Strict privacy is of paramount importance in distributed machine learning. Federated learning, with the main idea of communicating only what is needed for learning, has been recently introduced as a general approach for distributed learning to enhance learning and improve security. However, federated learning by itself does not guarantee any privacy for data subjects. To quantify and control how much privacy is compromised in the worst-case, we can use differential privacy. In this paper we combine additively homomorphic secure summation protocols with differential privacy in the so-called cross-silo federated learning setting. The goal is to learn complex models like neural networks while guaranteeing strict privacy for the individual data subjects. We demonstrate that our proposed solutions give prediction accuracy that is comparable to the non-distributed setting, and are fast enough to enable learning models with millions of parameters in a reasonable time. To enable learning under strict privacy guarantees that need privacy amplification by subsampling, we present a general algorithm for oblivious distributed subsampling. However, we also argue that when malicious parties are present, a simple approach using distributed Poisson subsampling gives better privacy. Finally, we show that by leveraging random projections we can further scale-up our approach to larger models while suffering only a modest performance loss.

研究の動機と目的

  • 差分プライバシーの強い保証を満たす、クロスシロ分散型フェデレーテッドラーニング環境における複雑な機械学習モデルのプライバシー保護型学習を可能にすること。
  • データの出典が隠された分散環境において、サブサンプリングによるプライバシー強化を達成する課題に対処すること。
  • 安全なマルチパーティ計算とランダムプロジェクションを用いて、差分プライバシーを適用した分散型フェデレーテッドラーニングにおける計算および通信のオーバーヘッドを低減すること。
  • 信頼実行環境(TEEs)を用いた大規模分散学習における、プライバシー、精度、効率のトレードオフを評価すること。
  • 数百万パラメータを持つモデルに対しても、実用的でスケーラブルかつ高精度なDP-FLが実現可能であることを示すこと。

提案手法

  • 加法的準同型暗号を用いた安全なマルチパーティ計算(SMC)と差分プライバシーを組み合わせ、クロスシロFLにおけるモデル更新の安全な集約を実現する。
  • 任意のサンプリング方式(リプレースメントなしのサンプリングやポアソンサンプリングを含む)をサポートする、新しい無知の分散サブサンプリングアルゴリズムを導入する。
  • 悪意ある参加者が存在する状況では、複雑なリプレースメントなしのサンプリングに代えて、より堅牢な分散ポアソンサンプリングを採用する。
  • ランダムプロジェクションを活用して、モデル勾配を低次元の埋め込みに圧縮し、通信コストおよび暗号化コストを削減する。
  • サイドチャネル攻撃やメモリアクセス漏洩に対する防御を強化するため、信頼実行環境(TEEs)を追加のセキュリティ層として活用する。
  • サブサンプリングによるプライバシー強化を適用し、更新ごとのプライバシー予算を低減することで、全体の差分プライバシー保証を向上させる。

実験結果

リサーチクエスチョン

  • RQ1差分プライバシーを適用した分散型フェデレーテッドラーニングは、強いプライバシー保証のもとで、大規模なモデルに効率的にスケーリング可能か?
  • RQ2悪意ある参加者が存在する状況で、ポアソンサンプリングとリプレースメントなしのサンプリングの選択がプライバシーに与える影響は何か?
  • RQ3ランダムプロジェクションを用いることで、DP-FLにおける通信および計算のオーバーヘッドを低減しつつ、モデルの有用性をどの程度維持できるか?
  • RQ4安全なマルチパーティ計算と分散サブサンプリングを用いる場合、プライバシー、精度、実行時間のトレードオフはどのようなものか?
  • RQ5提案手法は、実際の運用において非分散DP学習に近い性能を達成できるか?

主な発見

  • 提案手法であるDP-SMCは、分散型ノイズ生成であっても、信頼できる中央集約者と同等の予測精度を達成する。
  • 8台のコンピュータノードを用いることで、合計実行時間を最大10倍短縮しつつ、精度への影響を最小限に抑え、約100万パラメータのモデルのスケーラブルな学習を実現する。
  • 悪意ある参加者が存在する状況では、分散ポアソンサンプリングが複雑なリプレースメントなしのサンプリングよりも優れたプライバシー保証を提供する。
  • 次元数k=100のランダムプロジェクションですら、暗号化通信量を1000倍まで削減しても、テスト精度は元のモデルと1〜2%の差にとどめる。
  • 本手法は、最大約9×10^5パラメータのモデルにスケーリング可能であり、(1.7, 10^-5)-DPを達成しつつ、許容できる精度損失と合理的な実行時間で動作する。
  • SMCとサブサンプリングを統合した本システムは、厳密なプライバシー要件のもとで、深層ニューラルネットワークの実用的で効率的な学習を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。