Skip to main content
QUICK REVIEW

[論文レビュー] Practical and Private (Deep) Learning without Sampling or Shuffling

Peter Kairouz, Brendan McMahan|arXiv (Cornell University)|Feb 26, 2021
Privacy-Preserving Technologies in Data参考文献 69被引用数 22
ひとこと要約

本稿では、サンプリングやシャッフルによるプライバシー拡張に依存せずに、競争力のあるプライバシー・アキュラシーのトレードオフを達成する、微分プライベートなオンライン学習アルゴリズムであるDP-FTRLを提案する。木アグリゲーションを用いた相関ノイズをFTRLフレームワークに組み込むことで、柔軟なデータアクセスパターンを実現し、複数のベンチマークにおいて、サンプリング・シャッフルによる拡張を伴わないDP-SGDおよび拡張されたDP-SGDを上回る性能を発揮する。特に、高精度・低プライバシーの環境下で顕著な優位性を示す。

ABSTRACT

We consider training models with differential privacy (DP) using mini-batch gradients. The existing state-of-the-art, Differentially Private Stochastic Gradient Descent (DP-SGD), requires privacy amplification by sampling or shuffling to obtain the best privacy/accuracy/computation trade-offs. Unfortunately, the precise requirements on exact sampling and shuffling can be hard to obtain in important practical scenarios, particularly federated learning (FL). We design and analyze a DP variant of Follow-The-Regularized-Leader (DP-FTRL) that compares favorably (both theoretically and empirically) to amplified DP-SGD, while allowing for much more flexible data access patterns. DP-FTRL does not use any form of privacy amplification. The code is available at https://github.com/google-research/federated/tree/master/dp_ftrl and https://github.com/google-research/DP-FTRL .

研究の動機と目的

  • フェデレーテッドおよび分散学習環境における、サンプリングまたはシャッフルによるプライバシー拡張の実用的制限を解消すること。
  • 一様なランダムミニバッチ選択やシャッフルを必要としない、強力なプライバシー保証を維持する微分プライベート最適化アルゴリズムの設計。
  • プライバシー拡張メカニズムに依存しないで、DP-SGDと同等または優れたモデル精度を達成すること。
  • データアクセスパターンが不規則であるか、クライアントの利用可能性に制限がある実世界のシステムにおける実用的導入を可能にすること。

提案手法

  • 木アグリゲーションを用いて累積勾配に相関ノイズを追加することで、微分プライベートなFTRL(DP-FTRL)の変種を提案。
  • 時間ステップ全体の勾配の合計にノイズを追加することで、各更新ごとのノイズではなく、差分プライバシーを保証する。
  • 独立したサンプリングやシャッフルを必要とせず、時間ステップにわたる相関ノイズに依存して強力なプライバシー保証を維持。
  • 非i.i.d.または限られたデータ環境下でのプライバシー会計とモデル性能の向上を図るため、DP-FTRLアルゴリズムにリスタート戦略を導入。
  • クライアント側のランダム性や参加のシャッフルのための調整を回避するため、ノイズ追加をモデル更新に直接統合。
  • プライバシー拡張なしに全体のプライバシー損失を制限するため、木アグリゲーション技術に基づくプライバシー会計法を採用。

実験結果

リサーチクエスチョン

  • RQ1サンプリングやシャッフルによるプライバシー拡張に依存せずに、強力なプライバシー・アキュラシーのトレードオフを達成できる微分プライベート学習アルゴリズムは存在するか?
  • RQ2異なるノイズレベルやデータアクセスパターン下で、DP-FTRLはDP-SGDと比較して、モデル精度とプライバシー保証の両面でどのように異なるか?
  • RQ3フェデレーテッド学習環境で一様なサンプリングやシャッフルの必要性を排除することの実用的意味は何か?
  • RQ4DP-FTRLにおける相関ノイズの追加は、DP-SGDにおける独立ノイズよりも優れたプライバシー・ユーティリティのトレードオフを提供できるか?
  • RQ5実際のフェデレーテッド学習展開において、報告目標(report goal)と集団サイズが、DP-FTRLとDP-SGDのプライバシー保証に与える影響は何か?

主な発見

  • DP-FTRLは、あらゆるプライバシー水準において、プライバシー予算が同じ条件下で、未拡張のDP-SGDを顕著に上回るテスト精度を達成する。
  • 高精度・低プライバシーの環境下では、DP-FTRLは拡張されたDP-SGDに対しても優位性を示し、特にStackOverflowおよびCIFAR-10ベンチマークで顕著である。
  • 24.5%のターゲットテスト精度を達成する状況で、DP-FTRLはε = 32.52および報告目標1000の条件下で24.51%の精度を達成したが、DP-SGDは同じ条件下で25.19%の精度に到達するためにはε = 7.71e4を必要とした。
  • 報告目標が1.03e4に設定された場合、DP-FTRLはε = 3.56を達成したが、DP-SGDはε = 8.11に到達するためには報告目標9.56e3を必要とした。これにより、DP-FTRLの優れたプライバシー効率性が示された。
  • 報告目標を100から1000に引き上げた場合、両アルゴリズムともユーティリティが向上したが、DP-FTRLははるかに優れたプライバシー・ユーティリティのトレードオフを維持し、ε = 32.52(DP-FTRL)とε = 7.71e4(DP-SGD)を達成した。
  • DP-FTRLにおけるリスタート戦略により、エポックに依存しない学習環境下での性能が向上し、限られたデータ量のラウンドでも収束性とプライバシー会計の両面で優れた結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。