Skip to main content
QUICK REVIEW

[論文レビュー] Locally Differentially Private Naive Bayes Classification

Emre Yılmaz, Mohammad Al-Rubaie|arXiv (Cornell University)|May 3, 2019
Privacy-Preserving Technologies in Data参考文献 17被引用数 12
ひとこと要約

本稿では、信頼できない集約者に送信する前に個々の参加者が局所的にデータを摂動させるため、プライバシーを保証しながら分類器の訓練を可能にする、局所的微分プライバシー(LDP)に基づくナイーブベイズ分類フレームワークを提案する。LDPによる周辺度推定により特徴量とラベルの関係を保持し、次元削減を組み合わせることで、特にε > 2の条件下でも高い分類精度を維持しながら、信頼できる中央管理者が不要な状況でも個人のプライバシーを確保する。

ABSTRACT

In machine learning, classification models need to be trained in order to predict class labels. When the training data contains personal information about individuals, collecting training data becomes difficult due to privacy concerns. Local differential privacy is a definition to measure the individual privacy when there is no trusted data curator. Individuals interact with an untrusted data aggregator who obtains statistical information about the population without learning personal data. In order to train a Naive Bayes classifier in an untrusted setting, we propose to use methods satisfying local differential privacy. Individuals send their perturbed inputs that keep the relationship between the feature values and class labels. The data aggregator estimates all probabilities needed by the Naive Bayes classifier. Then, new instances can be classified based on the estimated probabilities. We propose solutions for both discrete and continuous data. In order to eliminate high amount of noise and decrease communication cost in multi-dimensional data, we propose utilizing dimensionality reduction techniques which can be applied by individuals before perturbing their inputs. Our experimental results show that the accuracy of the Naive Bayes classifier is maintained even when the individual privacy is guaranteed under local differential privacy, and that using dimensionality reduction enhances the accuracy.

研究の動機と目的

  • 中央のデータ管理者を信頼できない場合に、機械学習のための機微な訓練データを収集する課題に対処すること。
  • 個々の参加者がデータを共有する前に摂動を行う局所的微分プライバシー(LDP)の下で、ナイーブベイズ分類器のプライバシー保護型訓練を可能にすること。
  • LDPによるデータ収集中に特徴量とラベルの統計的関係を保持することで、分類精度を維持すること。
  • 局所的摂動の前に次元削減技術を適用することで、高次元データにおけるノイズと通信コストを低減すること。
  • LDPベースの分類を離散的および連続的特徴量の両方のタイプに拡張し、連続的データに対してはガウスナイーブベイズを含むこと。

提案手法

  • 個々の特徴量の値を送信する前に、ランダム化応答やユニタリ符号化などの局所的微分プライバシー(LDP)メカニズムを適用して摂動すること。
  • 集約者で、Bassily & Smith(2015)、Wangら(2017)のLDP周辺度推定プロトコルを用いて、摂動済みデータから条件付き確率P(ラベル|特徴量)を推定すること。
  • 連続的特徴量の場合は、LDP摂動の前に区間分割(ボーリング)または次元削減(例:DCA)を適用してノイズと次元数を低減すること。
  • ナイーブベイズにおけるP(特徴量|ラベル)の正確な推定を保証するために、摂動の過程で特徴量とラベルの関係を保持すること。
  • 集約済みの摂動済みデータからすべての必要な条件付き確率を推定し、新たなインスタンスに対して標準的なナイーブベイズ推論を可能にすること。
  • 高次元設定においてノイズの蓄積と通信コストを低減するために、個々の参加者側で次元削減(例:DCA)を摂動の前に統合すること。

実験結果

リサーチクエスチョン

  • RQ1特徴量とラベルの関係を保持しつつ、局所的微分プライバシー(LDP)プロトコルをナイーブベイズ分類器の訓練に効果的に適応できるか?
  • RQ2離散的特徴量における符号化方式の選択(例:直接符号化、ユニタリ符号化)が、LDP下での分類精度に与える影響はいかほどか?
  • RQ3次元削減が、連続的データに対するLDPベースのナイーブベイズ分類の精度をどの程度向上させるか?
  • RQ4プライバシー予算εが、提案されたLDPナイーブベイズフレームワークにおけるプライバシーと分類精度のトレードオフに与える影響は?
  • RQ5強いプライバシー制約(例:ε ≤ 2)下でも、非プライベートなナイーブベイズと同等の高い分類精度を達成できるか?

主な発見

  • ε > 2の条件下では、LDPナイーブベイズ分類器の分類精度が非プライベートベースラインと非常に近くなることが確認され、優れたプライバシー・ユーティリティトレードオフを示した。
  • 離散的特徴量に対して直接符号化またはユニタリ符号化を用いることで、低いプライバシー予算でも高い分類精度が得られた。
  • 連続的特徴量の区間分割により、LDP推定におけるノイズが顕著に低減され、性能が向上した。
  • 局所的摂動の前にDCAなどの次元削減技術を適用することで、次元数とノイズを低減し、連続的データの分類精度が向上した。
  • 信頼できるデータ管理者が不要な状況でも、LDPに基づく大規模な訓練データ収集が可能となり、プライバシーが重要な分野への導入を促進した。
  • 本フレームワークは二値分類に限定されず、多値分類もサポートしており、先行するLDPベースの機械学習システムとは異なり、より広範な適用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。