Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Linear Bandits with Local Differential Privacy

Yuxuan Han, Zhipeng Liang|arXiv (Cornell University)|Jun 7, 2021
Advanced Bandit Algorithms Research参考文献 32被引用数 6
ひとこと要約

本稿では、一般化線形バンディットにおける局所的微分プライバシー(LDP)アルゴリズムを提案し、非プライベートな設定と同等のレグレットバウンドを達成する。確率的勾配降下法(SGD)と通常最小二乗推定(OLS)推定器を用い、プライバシー保護型の更新を実現することで、LDP下での最適なレグレットレートを確立した。合成データおよび実世界の自動融資データを用いた実験により、厳密なプライバシーパラメータ下でも優れた実験的性能を示した。

ABSTRACT

Contextual bandit algorithms are useful in personalized online decision-making. However, many applications such as personalized medicine and online advertising require the utilization of individual-specific information for effective learning, while user's data should remain private from the server due to privacy concerns. This motivates the introduction of local differential privacy (LDP), a stringent notion in privacy, to contextual bandits. In this paper, we design LDP algorithms for stochastic generalized linear bandits to achieve the same regret bound as in non-privacy settings. Our main idea is to develop a stochastic gradient-based estimator and update mechanism to ensure LDP. We then exploit the flexibility of stochastic gradient descent (SGD), whose theoretical guarantee for bandit problems is rarely explored, in dealing with generalized linear bandits. We also develop an estimator and update mechanism based on Ordinary Least Square (OLS) for linear bandits. Finally, we conduct experiments with both simulation and real-world datasets to demonstrate the consistently superb performance of our algorithms under LDP constraints with reasonably small parameters $(\varepsilon, δ)$ to ensure strong privacy protection.

研究の動機と目的

  • サーバーに対してユーザーのデータが常に機微な状態を保つ必要がある、パーソナライズドなオンライン意思決定におけるプライバシー懸念を解決すること。
  • 局所的微分プライバシー(LDP)下で、非プライベートな文脈バンディットアルゴリズムと比較して、レグレットギャップを解消すること。
  • 非プライベートな性能に匹敵する、効率的かつプライバシー保護型の学習アルゴリズムを一般化線形バンディット用に設計すること。
  • 強いプライバシー制約下で、シミュレートされたデータおよび実世界のデータセットに対して提案手法を検証すること。

提案手法

  • 一般化線形バンディットにおける局所的微分プライバシー(LDP)を保証する確率的勾配ベースの推定器および更新メカニズムを開発する。
  • 理論的柔軟性を活かし、一般化線形バンディット問題に特化したプライバシー保証付きの確率的勾配降下法(SGD)を適応する。
  • LDP下での線形バンディットにおいて、OLSベースの推定器および更新メカニズムを設計し、プライバシーを確保しつつ正確なパラメータ推定を実現する。
  • 探索と活用のバランスを保ちつつプライバシーを確保するため、グリーディアルゴリズムをプライベートなOLSおよびSGD推定器と統合する。
  • KLダイバージェンスの連鎖則および集中不等式を用いて、理論的レグレットバウンドを導出する。
  • 各ユーザーの文脈および行動が$(\varepsilon,\delta)$-LDPのもとで保護されるよう、プライベート推定フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1一般化線形バンディットにおけるLDPアルゴリズムを設計できるか。その場合、非プライベート設定と同等のレグレットレートを達成できるか。
  • RQ2バンディット学習において、強い局所的微分プライバシーを確保しつつ、推定精度を維持する方法は何か。
  • RQ3確率的一般化線形バンディットにおいて、プライバシー($\varepsilon$で制御)とレグレットパフォーマンスの最適なトレードオフは何か。
  • RQ4プライベートなSGDおよびOLS推定器を、グリーディ探索戦略と効果的に組み合わせることで、LDP下で最適なレグレットを達成できるか。
  • RQ5提案フレームワークは、合成的および実世界の設定において、既存のLDPバンディットアルゴリズムを上回る性能を示すか。

主な発見

  • 提案されたLDP-SGDおよびLDP-GLOCアルゴリズムは、単一パラメータの確率的一般化線形バンディット設定において、$\tilde{O}(T^{1/2}/\varepsilon)$のレグレットを達成し、非プライベートなバウンドと一致する。
  • 複数パラメータ設定では、$\beta$-マージン条件のもとで、$\tilde{O}(T^{(1-\beta)/2}/\varepsilon^{1+\beta})$のレグレットを達成する。ここで$\beta \in [0,1)$である。
  • 特別な場合$\beta = 1$では、レグレットバウンドは$O((\log T / \varepsilon)^2)$に簡略化され、LDP下での複数パラメータケースにおいて最適であることが示された。
  • 実世界の自動融資データを用いた実験では、$\varepsilon = 1$のもとで、LDP-SGDおよびLDP-GLOCが非プライベートおよび先行LDPベースラインを一貫して上回るレグレット性能を示した。
  • 理論的分析により、下界$\Omega(\sqrt{Td}/(e^{\varepsilon}-1))$が確立され、提案されたレグレットレートの最適性が裏付けられた。
  • 本フレームワークは、実世界の応用(例:ロジット需要モデルを含む非線形報酬構造)においても、効果的に処理できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。