Skip to main content
QUICK REVIEW

[論文レビュー] Efficient, Noise-Tolerant, and Private Learning via Boosting

Mark Bun, Marco Carmosino|arXiv (Cornell University)|Feb 4, 2020
Privacy-Preserving Technologies in Data参考文献 19被引用数 4
ひとこと要約

本論文は、大マージン半空間のためのプライバシー保護型、ノイズ耐性型、かつ効率的なブースティングアルゴリズムを構築するモジュラーなフレームワークを導入する。弱学習者を強学習者に変換する手法として、滑らかブースティングにプライバシー保護メカニズム(特にラージBregman射影とガウスノイズ)を組み合わせることで、次元に依存しないサンプル複雑性を達成。プライバシーと精度の境界は、ノイズ耐性と信頼度に応じて良好にスケーリングされる。

ABSTRACT

We introduce a simple framework for designing private boosting algorithms. We give natural conditions under which these algorithms are differentially private, efficient, and noise-tolerant PAC learners. To demonstrate our framework, we use it to construct noise-tolerant and private PAC learners for large-margin halfspaces whose sample complexity does not depend on the dimension. We give two sample complexity bounds for our large-margin halfspace learner. One bound is based only on differential privacy, and uses this guarantee as an asset for ensuring generalization. This first bound illustrates a general methodology for obtaining PAC learners from privacy, which may be of independent interest. The second bound uses standard techniques from the theory of large-margin classification (the fat-shattering dimension) to match the best known sample complexity for differentially private learning of large-margin halfspaces, while additionally tolerating random label noise.

研究の動機と目的

  • プライバシーとノイズ耐性を維持しつつ、従来の構成を簡素化する一般的でモジュラーなプライベートブースティングフレームワークを設計すること。
  • 入力次元に依存しないサンプル複雑性を有する、効率的でプライバシー保護型のPAC学習を可能にし、大マージン半空間を学習すること。
  • ファットシャラッジング次元を用いて一般化を保証することで、ランダム分類ノイズの存在下でもノイズ耐性を達成すること。
  • 差分プライバシーが一般化を促進するツールとして機能することを示し、標準的な学習理論とは独立して、プライバシー専用のサンプル複雑性境界を新たに提示すること。
  • ラージBregman射影と測度生成に基づく洗練された理論的枠組みを用いて、滑らかブースティング、差分プライバシー、ノイズ耐性を統合すること。

提案手法

  • ラージBregman射影を用いて訓練例の上に滑らかな分布を維持することで、プライバシーとノイズ耐性を保証する汎用的なブースティングスキーマを提案する。
  • ガウスノイズを用いたプライベートな弱学習者を用い、ラベルノイズ下でもランダムな推測より一定の優位性を維持する。
  • 弱仮説を重み付き多数決で組み合わせるプライベートブースティングアルゴリズムを適用し、zCDP(ゼロ集中差分プライバシー)とタイトな合成境界によりプライバシーを保証する。
  • プライバシーを一般化の促進要因として扱う、新規のプライベート専用サンプル複雑性境界を導入する。
  • ファットシャラッジング次元を用いて一般化誤差を制限し、ランダムノイズ下でも高確率で低テスト誤差を達成する。
  • チェルノフの不等式と集中不等式を用いて、汚染されたサンプルやノイズによる効用損失に起因する失敗確率を制御する。

実験結果

リサーチクエスチョン

  • RQ1差分プライバシー、ノイズ耐性、効率性を同時に達成できる統一されたフレームワークを設計できるか?
  • RQ2差分プライバシーは、データ保護の他に、学習アルゴリズムの一般化を向上させるためにどのように利用できるか?
  • RQ3ランダム分類ノイズ下で、大マージン半空間のための差分プライバシー学習に最適なサンプル複雑性は何か?
  • RQ4ガウスノイズやBregman射影といったプライバシー保護メカニズムを用いて、ブースティングにおける滑らかさとロバストネスを維持できるか?
  • RQ5プライバシー、滑らかさ、ファットシャラッジング次元の相互作用が、プライベート学習における最終的な一般化誤差にどのように影響するか?

主な発見

  • 提案されたHS-StLアルゴリズムは、入力次元に依存しないサンプル複雑性 $n = O\left(\frac{\sqrt{\log(1/\kappa)\log(1/\delta)\log(\log(1/\kappa)/\beta\tau)}}{\epsilon\kappa\tau^{2}}\right)$ を達成し、$(\rho, \tau)$-マージン半空間学習を実現する。
  • プライベート専用サンプル複雑性境界は、差分プライバシーそのものが一般化を保証できることを示し、$O\left(\frac{\sqrt{\log(1/\kappa)\log(1/\delta)\log(\log(1/\kappa)/\beta\tau^{2})}}{\epsilon\alpha\tau^{2}}\right)$ の境界を有する。
  • アルゴリズムは $O(\alpha\tau)$ のレートでランダム分類ノイズに耐性を示し、高確率でテスト誤差 $\leq \alpha$ を達成する。
  • $T = \frac{1024\log(1/\kappa)}{\tau^{2}}$ ラウンドの後、最終仮説は、汚染されていない例の $\kappa$ 分率を除き、すべての例に対してマージン $\gamma = \tau/8$ を達成する。
  • フレームワークは $\rho_T$-zCDP とタイトな合成により $(\epsilon,\delta)$-差分プライバシーを保証し、$\rho_T = O\left(\frac{\log(1/\kappa)}{(\kappa n\sigma\tau)^2}\right)$ である。
  • 汚染されたサンプル、ノイズによる効用損失、一般化失敗に起因する失敗確率はすべて $\beta/3$ 以下に抑えられ、全体の成功確率は $1 - \beta$ に保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。