[論文レビュー] Locally Differentially Private (Contextual) Bandits Learning
本稿は、局所的微分プライバシー(LDP)におけるローカルに異なるプライバシーを満たす文脈的バンディット問題のブラックボックス還元フレームワークを導入し、複数の設定でより良いレグレットバウンドを達成する。LDP下での複数点フィードバックバンディット凸最適化(BCO)に対して、初めて $ frac{1}{2}$-レグレットバウンドを達成し、一般化線形バンディット(GLB)においては $ frac{3}{4}$-レグレットに拡張され、文脈的バンディットにおけるLDPとDPの間の根本的な差異が示された。
We study locally differentially private (LDP) bandits learning in this paper. First, we propose simple black-box reduction frameworks that can solve a large family of context-free bandits learning problems with LDP guarantee. Based on our frameworks, we can improve previous best results for private bandits learning with one-point feedback, such as private Bandits Convex Optimization, and obtain the first result for Bandits Convex Optimization (BCO) with multi-point feedback under LDP. LDP guarantee and black-box nature make our frameworks more attractive in real applications compared with previous specifically designed and relatively weaker differentially private (DP) context-free bandits algorithms. Further, we extend our $(\varepsilon, δ)$-LDP algorithm to Generalized Linear Bandits, which enjoys a sub-linear regret $ ilde{O}(T^{3/4}/\varepsilon)$ and is conjectured to be nearly optimal. Note that given the existing $Ω(T)$ lower bound for DP contextual linear bandits (Shariff & Sheffe, 2018), our result shows a fundamental difference between LDP and DP contextual bandits learning.
研究の動機と目的
- 局所的微分プライバシー(LDP)下での文脈なしおよび文脈的バンディット問題に対する一般的でプライバシーを保証するフレームワークの欠如に対処すること。
- 非プライベートなバンディット学習とプライベートなバンディット学習の間のギャップを埋め、LDP下で近似的に最適なレグレットを達成すること。
- より複雑で現実的である一般化線形バンディット(GLB)にLDPの保証を拡張すること。
- 文脈的バンディットにおけるLDPとDPの根本的な違いを示すこと。LDPはDPよりも高いレグレットを引き起こす。
提案手法
- 非プライベートなバンディットアルゴリズムを最小限の変更でLDP準拠のものに変換するブラックボックス還元フレームワークを提案する。
- クライアント側でランダム化応答とノイズ注入を用いて、ユーザーのフィードバックおよびコンテキストベクトルを保護し、LDPを満たす。
- プライバシー制約下でもモデルの正確性を維持するため、摂動を加えたデータを用いた正則化最小二乗推定を用いる。
- 集中不等式と高確率バウンドを用いて、ノイズの存在下での推定誤差を制御する。
- 設計行列によって誘導される重み付き内積空間における推定誤差の分解とノルム制御を通じて、レグレットバウンドを導出する。
- LDP下での正則化最小二乗解の誤差をバウンドする新しい解析技術を導入し、タイトなレグレット保証をもたらす。
実験結果
リサーチクエスチョン
- RQ1非プライベートなバンディットアルゴリズムを最小限の性能劣化でLDP準拠に変換できる一般的でブラックボックスなフレームワークを設計できるか?
- RQ2LDP下での複数点フィードバックバンディット凸最適化(BCO)に対して、最適なレグレットは何か?
- RQ3LDPを一般化線形バンディットに意味的に拡張可能か?また、達成可能なレグレットバウンドは何か?
- RQ4DP文脈的バンディットと比較して、LDP文脈的バンディットのレグレットはどのように異なるか?DPには既知の $ frac{1}{2}$-レグレット下界がある。
- RQ5LDP一般化線形バンディットにおける $ frac{3}{4}$-レグレットバウンドはほぼ最適であるか?
主な発見
- 提案されたブラックボックスフレームワークは、$( varepsilon,\delta)$-LDP下で1点フィードバックのバンディット凸最適化(BCO)に対して $ frac{3}{4}$-レグレットを達成し、先行研究を改善した。
- LDP下で、複数点フィードバックBCOに対して初めて $ frac{1}{2}$-レグレットバウンドを達成し、非プライベートな最適レートに一致した。
- 一般化線形バンディット(GLB)において、$( varepsilon,\delta)$-LDP下で $ frac{3}{4}$-レグレットを達成した。これはほぼ最適であると予想されている。
- 解析により、LDPは文脈的バンディットにおいて根本的な制限をもたらすことが明らかになった。レグレットは $ frac{3}{4}$ で下限され、非プライベート設定の $ frac{1}{2}$-レグレットとは対照的である。
- 本稿はLDPとDPの間の重要な違いを確立した。DP文脈的バンディットは $ frac{1}{2}$-レグレット下界を負っているが、LDP文脈的バンディットは $ frac{3}{4}$-レグレットを下回ることはできず、より強いプライバシーコストが生じることを示した。
- フレームワークは強力なプライバシー保証(LDP)を維持しながら、近似的に最適なレグレットを達成しており、機微なユーザー情報を含む実世界の応用に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。