Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Contextual Bandits.

Awni Hannun, Brian Knott|arXiv (Cornell University)|Oct 11, 2019
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

この論文では、機密性の高い特徴量、報酬、行動を共有せずに、複数の参加者が共同でモデルを学習できるプライバシー保護型コンテキストバンディットアルゴリズムを提案する。セキュアなマルチパーティ計算とエプシロン・グリーディ探索機構を組み合わせることで、分散環境下でも差分プライバシーを確保しながら累積報酬を最大化する。

ABSTRACT

Contextual bandits are online learners that, given an input, select an arm and receive a reward for that arm. They use the reward as a learning signal and aim to maximize the total reward over the inputs. Contextual bandits are commonly used to solve recommendation or ranking problems. This paper considers a learning setting in which multiple parties aim to train a contextual bandit together in a private way: the parties aim to maximize the total reward but do not want to share any of the relevant information they possess with the other parties. Specifically, multiple parties have access to (different) features that may benefit the learner but that cannot be shared with other parties. One of the parties pulls the arm but other parties may not learn which arm was pulled. One party receives the reward but the other parties may not learn the reward value. This paper develops a privacy-preserving contextual bandit algorithm that combines secure multi-party computation with a differential private mechanism based on epsilon-greedy exploration in contextual bandits.

研究の動機と目的

  • 機密性の高い特徴量、行動、報酬を共有せずに、複数の参加者がコンテキストバンディットモデルを共同で学習できるようにすること。
  • データを共有できないマルチパーティ環境において、探索過程での差分プライバシーを維持すること。
  • どの参加者も、どのアームが引かれたか、または報酬値を学習しないようにすること、たとえ特徴量を提供したとしても。
  • 分散環境における各参加者間で厳密なプライバシー制約を満たしつつ、高い学習パフォーマンス(累積報酬)を維持すること。
  • 実世界の推薦やランク付けアプリケーションに適した、コンテキストバンディットフレームワークにおいて、セキュアなマルチパーティ計算と差分プライバシーを統合すること。

提案手法

  • アルゴリズムは、参加者間で入力や出力を露呈させずにモデル更新を計算するセキュアなマルチパーティ計算(MPC)を用いる。
  • 各参加者はモデルに特徴量を提供するが、他の参加者の特徴量や選択されたアームを学習しない。
  • エプシロン・グリーディ探索戦略を適用し、探索意思決定を差分プライバシー機構でノイズを加えることで、行動選択を保護する。
  • 報酬は1つの参加者によって収集されるが、他の参加者には開示されない。モデル更新には差分プライバシー信号のみが使用される。
  • この方法により、すべての参加者のデータから学習が可能であり、同時に(エプシロン、デルタ)差分プライバシーの保証が満たされる。
  • 異種の共有不可な特徴セットを持つ複数の参加者にスケーラブルに拡張可能であり、プライバシーと実用性を両立する。

実験結果

リサーチクエスチョン

  • RQ1複数の参加者が機密性の高い特徴量を共有せずに、どのようにコンテキストバンディットモデルを共同で学習できるか?
  • RQ2どの参加者も、どのアームが引かれたか、または報酬値を学習しないようにするためのメカニズムは何か?
  • RQ3差分プライバシーをセキュアなマルチパーティ計算と効果的に統合できるか、コンテキストバンディット環境において?
  • RQ4プライバシー保護機構は、非プライベートなベースラインと比較して累積報酬にどのように影響するか?
  • RQ5このマルチパーティ環境において、プライバシー(エプシロン)と学習パフォーマンスのトレードオフは何か?

主な発見

  • 提案手法は、すべての参加者に対して差分プライバシーを保ちながら、高い累積報酬を達成した。
  • セキュアなマルチパーティ計算の使用により、どの参加者も他者の特徴量、行動、報酬に関する機密情報を学習しない。
  • エプシロン・グリーディ探索と差分プライバシーの統合により、探索意思決定がプライベートかつ統計的に保護された。
  • 特徴量が共有不可で参加者が信頼できない環境においても、モデルの実用性が維持された。
  • 異種のデータを持つ複数の参加者にスケーラブルに拡張可能であり、学習パフォーマンスを犠牲にせずプライバシーを確保した。
  • 実験結果から、本手法が強力なプライバシー保証を提供するとともに、競争力のある学習結果を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。