Skip to main content
QUICK REVIEW

[論文レビュー] Differential Private Stack Generalization with an Application to Diabetes Prediction

Quanming Yao, Xiawei Guo|arXiv (Cornell University)|Nov 23, 2018
Privacy-Preserving Technologies in Data参考文献 33被引用数 4
ひとこと要約

本稿では、サンプルまたは特徴に基づくデータ分割を用いたアンサンブル学習を活用して、プライバシー保護型ロジスティック回帰の性能を向上させるため、微分プライバシー付きスタッキング(PST)を提案する。理論的および実験的に、特徴ベースの分割がサンプルの複雑さを低減し、予測性能を向上させることを示し、特に特徴の重要度を組み込むことで、組織間の糖尿病予測において最先端の結果を達成しながらプライバシーを保持する。

ABSTRACT

To meet the standard of differential privacy, noise is usually added into the original data, which inevitably deteriorates the predicting performance of subsequent learning algorithms. In this paper, motivated by the success of improving predicting performance by ensemble learning, we propose to enhance privacy-preserving logistic regression by stacking. We show that this can be done either by sample-based or feature-based partitioning. However, we prove that when privacy-budgets are the same, feature-based partitioning requires fewer samples than sample-based one, and thus likely has better empirical performance. As transfer learning is difficult to be integrated with a differential privacy guarantee, we further combine the proposed method with hypothesis transfer learning to address the problem of learning across different organizations. Finally, we not only demonstrate the effectiveness of our method on two benchmark data sets, i.e., MNIST and NEWS20, but also apply it into a real application of cross-organizational diabetes prediction from RUIJIN data set, where privacy is of significant concern.

研究の動機と目的

  • 微分プライバシーにおけるノイズ注入によって引き起こされるプライバシー保護型機械学習の性能低下を是正すること。
  • アンサンブルスタッキングを用いて、プライバシーを損なわず予測精度を向上させる、微分プライバシー付きロジスティック回帰の強化。
  • 微分プライバシー制約下でのスタッキングにおいて、サンプルベースと特徴ベースの分割戦略を比較すること。
  • 特に医療データ環境における組織間学習を想定し、仮説トランスファー学習を微分プライバシーと統合すること。
  • ベンチマークデータセットおよびRUIJINデータセットを用いた実世界の糖尿病予測応用において、手法を検証すること。

提案手法

  • 訓練データをサンプルまたは特徴に基づいて分割し、複数の低レベルモデルを学習する、微分プライバシー付きスタッキング(PST)フレームワークを提案する。
  • 低レベルモデルの予測を統合する高レベルのロジスティック回帰モデルを用い、エンドツーエンドの微分プライバシーを保証する。
  • 特徴の重要度に基づいて特徴をグループ化する特徴ベースの分割を導入し、サンプルベースの分割と比較してサンプルの複雑さを低減する。
  • トランスファー学習におけるソースドメインおよびターゲットドメインにわたるプライバシー予算の割り当て戦略を適用し、両者に ε = 1.0 を設定する。
  • ドメインエキスパートが提供する特徴の重要度スコアを用いて、特徴ベースPSTにおけるグループ化の重みを設定し、モデル性能の向上を図る。
  • ε-微分プライバシーに適合したノイズ注入メカニズムを採用し、理論的プライバシー保証を確保する。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー付きスタッキングにおける特徴ベースの分割は、サンプルベースの分割よりも低いサンプル複雑さを達成するか?
  • RQ2特徴の重要度を分割プロセスに統合することで、微分プライバシー下での予測性能がさらなる向上を遂げるか?
  • RQ3提案手法PSTは、標準的なプライバシー保護型ロジスティック回帰(PLR)およびトランスファー学習ベースラインと比較して、組織間学習において優れた性能を示すか?
  • RQ4提案手法は、実世界の医療予測において、患者のプライバシーを保持したまま最先端の性能を達成できるか?
  • RQ5ノイズ注入がモデル性能に与える影響は何か?また、スタッキングはこの性能低下を効果的に緩和できるか?

主な発見

  • PSTにおける特徴ベースの分割は、同じプライバシー予算下でサンプルベースの分割よりも少ないサンプル数で実現可能であり、低いサンプル複雑さとより優れた実験的性能を示す。
  • ドメインエキスパートが提供する特徴の重要度を統合したPST-F(W)は、NEWS20データセットで最高のAUC(0.932)を達成し、他の手法を上回る。
  • RUIJIN糖尿病データセットにおいて、PST-F(W)はPLR(target)およびPPHTLを上回り、組織間学習における予測性能が最良である。
  • ベンチマークデータセットにおいて、提案手法は標準的なPLRより最大でAUCを0.035向上させ、顕著な性能向上を示す。
  • 実験結果から、特徴の重要度統合が、特に低データ環境および組織間設定において性能向上をもたらすことが確認された。
  • すべての実験においてε-微分プライバシー(ε = 1.0)を維持しており、強力なプライバシー保証が確保されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。