Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-preserving Active Learning on Sensitive Data for User Intent Classification

Oluwaseyi Feyisetan, Thomas M Drake|arXiv (Cornell University)|Mar 26, 2019
Privacy-Preserving Technologies in Data参考文献 29被引用数 7
ひとこと要約

この論文は、クラウドソーシングによるラベル付けの過程で機微なユーザーの意図を保護するために、微分プライバシー(DP)とアクティブラーニングを統合したプライバシー保護型アクティブラーニングフレームワークを提案する。制御されたサンプリングとkアナニマスティーを用いてDPを適用することで、(ε, δ)-DPで測定される定量的プライバシー保証を達成するとともに、ラベル付け予算を削減し、競争力のあるモデル精度を維持する。これはプライバシー、有用性、コストの間で調整可能なトレードオフを示している。

ABSTRACT

Active learning holds promise of significantly reducing data annotation costs while maintaining reasonable model performance. However, it requires sending data to annotators for labeling. This presents a possible privacy leak when the training set includes sensitive user data. In this paper, we describe an approach for carrying out privacy preserving active learning with quantifiable guarantees. We evaluate our approach by showing the tradeoff between privacy, utility and annotation budget on a binary classification task in a active learning setting.

研究の動機と目的

  • 外部のラベラーに機微なユーザーのデータを送信する際のプライバシーリスクに対処すること。
  • アクティブラーニングパイプラインにおけるデータラベリングプロセス中にプライバシー保証を定量化および強制すること。
  • 二値のユーザーの意図分類タスクにおいて、(ε, δ)-微分プライバシーによるプライバシー、モデルの有用性(精度)、ラベル付け予算の間のトレードオフを評価すること。
  • 微分プライバシーがテキストデータに対してアクティブラーニングに効果的に適用可能であることを示し、kアナニマスティーの制限を克服すること。
  • 測定可能なプライバシーとパフォーマンスのトレードオフを伴う、実世界のNLPアプリケーションへのプライバシー保護型アクティブラーニングの導入フレームワークを提供すること。

提案手法

  • 未ラベルデータに(ε, δ)-微分プライバシーを適用し、ラベラーに送信することで、個々のデータポイントが一意に再特定されないことを保証する。
  • パラメータβを用いたサンプリングメカニズムにより、ラベル付け用にランダムにデータポイントの一部を選択し、再特定リスクを低減する。
  • 類似したクエリをグループ化することでkアナニマスティーを強制し、各クエリがバッチ内で少なくともk回以上出現することを保証することで、頻度分析による再特定を防ぐ。
  • アクティブラーニングにおける不確実性サンプリングとDP制約を組み合わせ、プライバシーを保持しながら最も情報量の多い例を選択する。
  • 既存のDPアルゴリズムを文献から活用し、プライバシー機構を実装する。パラメータβ(サンプリングレート)とk(アナニマスティー要因)を調整することで、望ましい(ε, δ)レベルを達成する。
  • 本手法は二値のユーザーの意図分類タスクで評価され、さまざまな(ε, δ)およびk/βの設定において、プライバシー、精度、予算を測定する。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシーは、クラウドソーシングによるラベル付けの過程で機微なユーザークエリを保護するために、テキストベースのアクティブラーニングに効果的に適用可能か?
  • RQ2機微なデータを伴うアクティブラーニングにおいて、プライバシー((ε, δ)で測定)、モデルの有用性(精度)、ラベル付け予算の間のトレードオフは何か?
  • RQ3kアナニマスティーとサンプリングレートβは、NLPにおけるアクティブラーニングのプライバシー-有用性トレードオフにどのように寄与するか?
  • RQ4提案手法は、kアナニマスティー単体よりも強いプライバシー保証を達成できるか、かつ妥当なモデルパフォーマンスを維持できるか?
  • RQ5タスクの複雑さが、NLPにおけるアクティブラーニングにDPを適用した際の精度損失にどのように影響するか?

主な発見

  • サンプリングレートβと匿名化要因kを調整することで、(ε, δ)-微分プライバシー保証を達成する。より強いプライバシー(より小さいε, δ)を実現するには、kを高くし、βを低くする必要がある。
  • δ = 1×10⁻⁶およびε = 1.0の場合、β = 0.1、k = 20で68.7%の精度を達成し、強いプライバシー-有用性のバランスを示している。
  • βを0.9から0.1に低下させることでプライバシー保証が向上するが、精度はわずかに低下する。これは明確なプライバシー-コストのトレードオフを示している。
  • δを1×10⁻¹⁵に低下させた場合、β = 0.1、k = 20で精度が64.7%に低下し、より強いプライバシー制約がより高い有用性コストを伴うことを示している。
  • kアナニマスティー単体よりも本手法が優れている。kが小さいか、データが極めてユニークな場合には、kアナニマスティー単体では十分なプライバシー保証が得られない。
  • 本フレームワークは、アクティブラーニングにおけるプライバシーを定量化および制御可能であることを示しており、測定可能なリスク低減を伴う、機微なNLPアプリケーションへの展開を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。