Skip to main content
QUICK REVIEW

[論文レビュー] Scalable and Provably Accurate Algorithms for Differentially Private Distributed Decision Tree Learning

Kaiwen Wang, Travis Dick|arXiv (Cornell University)|Dec 19, 2020
Privacy-Preserving Technologies in Data参考文献 24被引用数 4
ひとこと要約

本稿では、分散環境を想定した、微分プライバシーを満たすトップダウン型意思決定木学習フレームワーク「DP-TopDown」を提案する。2つの実装形態を用いる:NoisyCounts(グローバルノイズ集約)とLocalRNM(通信量とノイズを低減するための局所最適化)。プライベート意思決定木のための、初めての理論的正確性保証を提供し、弱学習仮定の下で、データセットが大きくなるに従い誤差が急速に減少することを示している。

ABSTRACT

This paper introduces the first provably accurate algorithms for differentially private, top-down decision tree learning in the distributed setting (Balcan et al., 2012). We propose DP-TopDown, a general privacy preserving decision tree learning algorithm, and present two distributed implementations. Our first method NoisyCounts naturally extends the single machine algorithm by using the Laplace mechanism. Our second method LocalRNM significantly reduces communication and added noise by performing local optimization at each data holder. We provide the first utility guarantees for differentially private top-down decision tree learning in both the single machine and distributed settings. These guarantees show that the error of the privately-learned decision tree quickly goes to zero provided that the dataset is sufficiently large. Our extensive experiments on real datasets illustrate the trade-offs of privacy, accuracy and generalization when learning private decision trees in the distributed setting.

研究の動機と目的

  • 分散環境下で高精度な意思決定木を学習する課題に取り組み、強力な微分プライバシー保証を維持すること。
  • 効率的でプライベートな分割メカニズムの設計により、分散意思決定木学習におけるプライバシーと精度のトレードオフを克服すること。
  • 単一マシンおよび分散環境下における、微分プライバシーを満たすトップダウン型意思決定木学習の理論的ユーティリティ保証を提供すること。
  • 実証的に、特に小規模またはノイズの多いデータセットにおいて、非プライベートなモデルよりもプライベートな意思決定木が一般化性能に優れている場合があることを示すこと。

提案手法

  • TopDownフレームワークに基づく、PrivateSplitと呼ばれるプライベートサブルーチンを用いた、微分プライバシーを満たす意思決定木アルゴリズムの族であるDP-TopDownを提案する。
  • NoisyCountsの実装:各データ保有者がラプラスノイズを含むクラスカウントを公開し、それらを集約して分割を決定する。これにより、微分プライバシーが保証されるが、高いノイズと通信量が発生する。
  • LocalRNMの導入:通信前に各データ保有者で局所最適化を実行することで、NoisyCountsに比べてノイズと通信量を顕著に低減するヒューリスティックを提案する。
  • 内部ノードの分割とリーフラベル付けの間でプライバシー予算を動的に割り当てるためのデイエットバジェット戦略を適用し、重要度の高い意思決定に優先的に予算を割り当てることで、精度を向上させる。
  • 分割基準としてエントロピーを用い、分割選択段階で指数機構またはラプラス機構を適用して微分プライバシーを保証する。
  • 弱学習仮定と理論的境界を活用し、データセットサイズが増加するに従い一般化誤差がゼロに収束することを示す、ユーティリティ保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1高精度を維持しつつ、強力なプライバシー保証を満たす分散型の微分プライバシーを満たす意思決定木学習アルゴリズムを設計できるか?
  • RQ2分散意思決定木学習において、内部ノードの分割とリーフラベル付けの間でのプライバシー予算の割り当てが、最終的なモデル精度に与える影響は何か?
  • RQ3グリーディな分割プロセスにノイズを注入することで、一般化性能が向上するのか。特に、非プライベートモデルが過学習を起こすような状況においては?
  • RQ4弱学習仮定の下で、単一マシンおよび分散環境下における微分プライバシーを満たす意思決定木の一般化誤差を理論的に境界づけられるか?
  • RQ5分散プライベート意思決定木学習において、通信コストとノイズレベルのトレードオフはどのように変化するか。また、局所最適化によりこのトレードオフを軽減できるか?

主な発見

  • DP-TopDownは、単一マシンおよび分散環境下における、微分プライバシーを満たすトップダウン型意思決定木学習の、初めての理論的正確性保証を提供する。データセットサイズが増加するに従い、誤差はゼロに収束する。
  • LocalRNMは、NoisyCountsに比べて複数の実世界データセット(Adult, Bank, Creditcard, Skin)において、テスト精度が優れている。これは、局所最適化によるノイズと通信量の低減に起因する。
  • CTRデータセットでは、特定のプライバシーパラメータにおいて、非プライベートベースラインよりもプライベートアルゴリズムがより高いテスト精度を達成しており、ノイズ注入がグリーディ学習における悪い局所最適解からの脱出を助ける可能性を示唆している。
  • 大規模なトレーニングデータセットは、プライベートモデルにおいて一貫して高いテスト精度と低い分散をもたらし、理論的期待と一致する。プライベート学習におけるデータ多様性の利点を裏付けている。
  • デイエットバジェット戦略により、重要度の高い意思決定に多くのプライバシー予算を割り当てることで性能が向上し、LeafPrivacyFractionを0.5に固定することで、実験全体で安定した結果が得られた。
  • トレーニング精度はデータセットサイズが増加するにつれて上昇するが、これは小さなデータセットが過学習に陥りやすいにもかかわらず、プライベート学習がデータスケールとノイズ正則化の恩恵を受けることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。