Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Multi-Party Contextual Bandits

Awni Hannun, Brian Knott|arXiv (Cornell University)|Oct 11, 2019
Privacy-Preserving Technologies in Data参考文献 37被引用数 8
ひとこと要約

本論文は、プライベートなコンテキスト特徴量、選択されたアーム、報酬値を共有せずに、複数の参加者が共同でコンテキストバンドイットモデルを学習できるプライバシー保護型マルチパーティーモデルを提案する。セキュアなマルチパーティ計算(MPC)とエプシロン・グリーディ探索機構を組み合わせることで、高い学習性能を維持しながら微分プライバシーを確保する。非プライベートなベースラインと比較して、わずかな精度損失で強い理論的プライバシー保証を達成する。

ABSTRACT

Contextual bandits are online learners that, given an input, select an arm and receive a reward for that arm. They use the reward as a learning signal and aim to maximize the total reward over the inputs. Contextual bandits are commonly used to solve recommendation or ranking problems. This paper considers a learning setting in which multiple parties aim to train a contextual bandit together in a private way: the parties aim to maximize the total reward but do not want to share any of the relevant information they possess with the other parties. Specifically, multiple parties have access to (different) features that may benefit the learner but that cannot be shared with other parties. One of the parties pulls the arm but other parties may not learn which arm was pulled. One party receives the reward but the other parties may not learn the reward value. This paper develops a privacy-preserving multi-party contextual bandit for this learning setting by combining secure multi-party computation with a differentially private mechanism based on epsilon-greedy exploration.

研究の動機と目的

  • 複数の参加者が、個々のプライベートなコンテキスト特徴量、選択されたアーム、報酬値を暴露せずに、コンテキストバンドイットモデルを共同で学習できるようにすること。
  • 参加者が誠実だが好奇心が強い(non-colluding)という脅威モデル下で、各参加者のデータに対する微分プライバシーを保証すること。
  • セキュアなマルチパーティ計算フレームワーク内での微分プライバシーを満たすエプシロン・グリーディ探索機構を用いることで、高い学習性能を維持すること。
  • 理論的プライバシー保証と、分散型でプライバシーに配慮した環境下でのアルゴリズムの有効性を実証的に検証すること。
  • 数値的不安定性、参加者の離脱、サイドチャネル漏洩、さらなるメンバー推定攻撃といった実用的課題を特定し、それらに対処すること。

提案手法

  • アルゴリズムは、個々の参加者のコンテキスト特徴量や行動を露呈せずにポリシーを共同で計算するために、セキュアなマルチパーティ計算(MPC)を用いる。
  • エプシロン・グリーディ探索戦略に微分プライバシーを組み合わせ、探索確率を(epsilon, delta)-微分プライバシー保証を満たすように調整する。
  • ポリシーは、連結されたコンテキスト特徴量上での線形モデルにより学習され、モデルパラメータはプライバシー保護された方法で最小二乗法により更新される。
  • 秘密分散を用いて、機密データ(例:コンテキストベクトル、報酬)を参加者間で分散表現することで、単一の参加者が全値を学習しないようにする。
  • 最小二乗法の逆行列更新には、Sherman-Morrisonの公式を用いるが、数値的安定性は制限要因であると指摘されている。
  • システムは、唯一の参加者だけがどのアームが選択されたかを学習し、唯一の参加者だけが報酬を観測するように設計されており、入力および出力のプライバシーを保持する。

実験結果

リサーチクエスチョン

  • RQ1他の参加者のコンテキスト特徴量、選択された行動、報酬値をすべて学習しない状態で、マルチパーティーモデルのコンテキストバンドイット学習が可能か?
  • RQ2コンテキストバンドイットに適したセキュアなマルチパーティ計算フレームワークに、微分プライバシーをどのように統合できるか?
  • RQ3この分散型プライバシー保護環境下で、プライバシー保証と学習性能のトレードオフはどのように変化するか?
  • RQ4数値的不安定性と参加者の離脱は、実用的文脈における本アルゴリズムの耐障害性にどのような影響を及ぼすか?
  • RQ5サイドチャネル攻撃やメンバー推定攻撃が、システムのプライバシーをどの程度脅かす可能性があり、それらをどのように緩和できるか?

主な発見

  • 本アルゴリズムは、セキュアなMPCと微分プライバシーを満たすエプシロン・グリーディ探索機構を組み合わせることで、各参加者のコンテキスト特徴量に対して(epsilon, delta)-微分プライバシーを達成する。
  • 実験的評価により、プライバシー保護型モデルが非プライベートなベースラインと比較して予測精度が非常に近く、わずかな性能差にとどまることが示された。
  • 誠実だが好奇心が強い脅威モデル下でも、本アルゴリズムは強いプライバシー保証を維持する。
  • Sherman-Morrisonの公式の繰り返し使用に起因する数値的不安定性が観察されたため、安定性を向上させるために定期的な行列逆行列計算と正則化の導入が求められる。
  • 報酬の遅延に起因するタイミング漏洩といったサイドチャネル攻撃が潜在的リスクであると特定され、情報漏洩を防ぐために遅延をランダム化することが推奨された。
  • 今後の課題として、攻撃的参加者への対応、より大きな行動集合のサポート、さらなるメンバー推定攻撃に対する耐性強化のためのフレームワーク拡張が不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。