Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning with Label Differential Privacy

Badih Ghazi, Noah Golowich|arXiv (Cornell University)|Feb 11, 2021
Privacy-Preserving Technologies in Data参考文献 92被引用数 6
ひとこと要約

本稿では、ラベル保護型学習における精度を向上させるために事前分布を活用する、新たなプライバシー保護アルゴリズムRRWithPriorを提案する。深層学習にラベル差分プライバシーを適用した場合、既存の最先端手法と比較して、非プライベートモデルとの精度差を顕著に縮小する。例えば、CIFAR-10でε=8、δ=10⁻⁵の条件下において73%の精度を達成した。

ABSTRACT

The Randomized Response (RR) algorithm is a classical technique to improve robustness in survey aggregation, and has been widely adopted in applications with differential privacy guarantees. We propose a novel algorithm, Randomized Response with Prior (RRWithPrior), which can provide more accurate results while maintaining the same level of privacy guaranteed by RR. We then apply RRWithPrior to learn neural networks with label differential privacy (LabelDP), and show that when only the label needs to be protected, the model performance can be significantly improved over the previous state-of-the-art private baselines. Moreover, we study different ways to obtain priors, which when used with RRWithPrior can additionally improve the model performance, further reducing the accuracy gap between private and non-private models. We complement the empirical results with theoretical analysis showing that LabelDP is provably easier than protecting both the inputs and labels.

研究の動機と目的

  • ラベルのみを保護する場合に顕著な性能差が生じる、差分プライバシーを適用した深層学習における継続的な性能ギャップを是正すること。
  • 古典的なランダム化応答(RR)手法を改善し、事前知識を統合することでノイズを低減し、精度を向上させること。
  • ラベルプライベートな深層学習をエンドツーエンドで実現可能な、実用的でマルチステージの訓練アルゴリズム(LP-MST)を開発すること。
  • ラベル差分プライバシーが入力とラベルを両方保護する場合よりも本質的に容易であることを示し、同じプライバシー予算下でより良いモデル性能を実現できることを証明すること。
  • 公開データ、事前学習済みモデル、または過去の訓練結果から得られる異なる種類の事前分布が、ラベルDP下でのモデル精度をどれほど向上させるかを調査すること。

提案手法

  • ラベルのアルファベットを事前分布𝒑を用いて縮小することで、真のラベルを返す確率を高める、改良型RRメカニズムであるRRWithPriorを提案する。
  • ε-差分プライバシー下での最適なプライバシーと精度のトレードオフについて閉形式の式を導出。RRWithPriorが、ラベルが事前分布から抽出される場合に正しい出力の確率を最大化することを示す。
  • ラベル回復確率の観点から、すべてのε-DPメカニズムの中でRRWithPriorが最適であることを示す線形計画法の定式化を導入する。
  • ラベル摂動段階でRRWithPriorを適用するマルチステージ訓練アルゴリズム(LP-MST)を設計。これにより、ラベルDP下での深層ニューラルネットワークの効率的訓練が可能になる。
  • 公開データ、事前学習済みモデル、または過去の訓練履歴から得られる事前分布を活用し、ラベル摂動の誤差をさらに低減し、モデルの一般化性能を向上させる。
  • 理論的分析により、ラベルDPが完全な入力およびラベルDPよりも厳密に容易であることが証明され、同じプライバシー予算下でより良い性能が得られることを裏付ける。

実験結果

リサーチクエスチョン

  • RQ1ラベルのみを保護する場合に、事前知識を活用することで、差分プライバシー学習の精度を向上させることができるか?
  • RQ2ラベルDP下でのモデル精度において、RRWithPriorは古典的RRおよび既存のプライベート深層学習ベースラインと比べてどのように差をつけるか?
  • RQ3公開データや事前学習済みモデルから得られるような、異なる種類の事前分布の中で、プライベート学習における精度ギャップを最も効果的に縮小するのはどれか?
  • RQ4ラベル差分プライバシーは、入力とラベルの両方を保護する場合よりも本質的に容易であると見なせるか? その結果、実測可能な性能向上が得られるか?
  • RQ5事前知識を組み込んだ摂動を統合した、実用的でスケーラブルな訓練パイプラインを、強力なプライバシー保証のもとで構築できるか?

主な発見

  • RRWithPriorは、ラベル空間を事前分布で縮小することで、古典的RRよりも高いラベル回復確率を達成し、同じプライバシー予算下で精度が向上する。
  • RRWithPriorを統合したLP-MST訓練パイプラインは、CIFAR-10でε=8、δ=10⁻⁵の条件下で73%のテスト精度を達成。これは、これまで報告された最高のプライベート結果に相当するが、より一般化可能で原理的根拠のあるアプローチである。
  • 特に事前分布が情報量が多い場合に、プライベートモデルと非プライベートモデルの間の精度ギャップ(以前は20ポイント以上)を、事前知識の活用によって顕著に縮小した。
  • 理論的分析により、ラベルDPが完全なDP(入力とラベルを両方保護)よりも厳密に容易であることが証明され、実験的に観察された性能向上を正当化する。
  • 事前学習済みモデルや公開データから得られる事前分布は、一般化誤差をさらに低減し、事前分布の品質が向上するほど性能向上が顕著になる。
  • ラダマッハ複雑度に基づく一般化誤差の境界により、プライベートモデルの一般化誤差が仮説クラスの複雑さと、事前知識を考慮した摂動メカニズムの複雑さに比例してスケーリングされることを示し、実験的成果の理論的裏付けが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。