[論文レビュー] Optimal Rates of (Locally) Differentially Private Heavy-tailed Multi-Armed Bandits
本稿は、$(1+v)$-次のモーメントが有限である重たい尾を持つ報酬分布の下で、局所的および中央集権的微分プライバシーを満たす多腕バンディット問題に対する最適なアルゴリズムを提案する。$v \in (0,1]$ に対して、UCB および逐次削除のプライベートでロバストな変種を導入し、情報理論的下界に一致するインスタンス依存のリグレットバウンドを達成する。$\epsilon$-LDP モデルでは、$O\left(\frac{1}{\epsilon^2} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v}\right)$ のタイトなレートを達成する。
In this paper we investigate the problem of stochastic multi-armed bandits (MAB) in the (local) differential privacy (DP/LDP) model. Unlike previous results that assume bounded/sub-Gaussian reward distributions, we focus on the setting where each arm's reward distribution only has $(1+v)$-th moment with some $v\in (0, 1]$. In the first part, we study the problem in the central $ε$-DP model. We first provide a near-optimal result by developing a private and robust Upper Confidence Bound (UCB) algorithm. Then, we improve the result via a private and robust version of the Successive Elimination (SE) algorithm. Finally, we establish the lower bound to show that the instance-dependent regret of our improved algorithm is optimal. In the second part, we study the problem in the $ε$-LDP model. We propose an algorithm that can be seen as locally private and robust version of SE algorithm, which provably achieves (near) optimal rates for both instance-dependent and instance-independent regret. Our results reveal differences between the problem of private MAB with bounded/sub-Gaussian rewards and heavy-tailed rewards. To achieve these (near) optimal rates, we develop several new hard instances and private robust estimators as byproducts, which might be used to other related problems. Finally, experiments also support our theoretical findings and show the effectiveness of our algorithms.
研究の動機と目的
- 報酬が有界またはサブガウス型であると仮定する従来の研究とは対照的に、重たい尾を持つ報酬分布の下での微分プライバシー付きバンディット学習におけるギャップを埋める。
- $(1+v)$-次のモーメント条件の下で、確率的多腕バンディット問題に対するプライベートでロバストなアルゴリズムを開発する。$v \in (0,1]$。
- $\epsilon$-DP および $\epsilon$-LDP モデルにおけるインスタンス依存およびインスタンス独立のリグレットバウンドを確立する。
- 提案されたアルゴリズムの最適性を証明するための理論的下界を提示する。
- 他のプライベート学習問題に一般化可能な、新しいプライベートでロバストな推定器およびハードインスタンスを設計する。
提案手法
- プライベートでロバストな上界信頼区間(UCB)アルゴリズムを $\epsilon$-DP モデルに提案。微分プライバシーを確保するためにノイズを注入しつつ、重たい尾を持つ報酬に対してロバスト性を維持する。
- より優れたリグレット性能を実現するため、$\epsilon$-DP モデルにおける逐次削除(SE)アルゴリズムのプライベートでロバストなバージョンを導入。
- $\epsilon$-LDP モデルにおけるローカルプライベートでロバストな SE アルゴリズムを設計。データ収集段階でのプライバシーを保証する。
- 重たい尾を持つ分布の下で平均を正確に推定しつつプライバシーを保持するため、プライベートでロバストな推定器を活用。
- 提案されたアルゴリズムの最適性を示すために、情報理論的下界を導出するための新しいハードインスタンスを構築。
- Bretagnolle-Hubert の不等式およびKLダイバージェンス解析を用いて、$\epsilon$-LDP 環境下での期待リグレットの下界を導出。
実験結果
リサーチクエスチョン
- RQ1重たい尾を持つ報酬分布で、$(1+v)$-次のモーメントが有限である条件の下で、微分プライバシー付き多腕バンディット問題の最適なインスタンス依存リグレットレートは何か?
- RQ2報酬が有界またはサブガウス型の仮定と比較して、重たい尾を持つ報酬の下でプライベートバンディットアルゴリズムの性能はどの程度劣化するか?
- RQ3UCB および逐次削除のプライベートでロバストな変種は、$\epsilon$-DP および $\epsilon$-LDP モデルの両方で近似的に最適なリグレットを達成できるか?
- RQ4重たい尾を持つ報酬の下でのプライベートバンディット学習の情報理論的限界は何か? そして、実用的なアルゴリズムがそれらの限界を達成できるか?
- RQ5プライバシー制約の下で重たい尾を持つ報酬を扱うために、どのような新しいプライベートでロバストな推定技術が必要か?
主な発見
- 提案されたプライベートでロバストなUCBアルゴリズムは、$\epsilon$-DP モデルでインスタンス依存リグレット $O\left(\frac{1}{\epsilon} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ を達成する。
- $\epsilon$-DP モデルにおける改善されたプライベートでロバストなSEアルゴリズムは、下界 $\Omega\left(\frac{1}{\epsilon} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ に一致し、インスタンスごとの最適性を証明する。
- $\epsilon$-LDP モデルでは、提案されたアルゴリズムがインスタンス依存リグレット $O\left( \frac{1}{\epsilon^2} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ を達成し、下界 $\Omega\left( \frac{1}{\epsilon^2} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ と一致する。
- インスタンス独立リグレットに関しては、$\epsilon$-LDP アルゴリズムが $O\left( \left(\frac{K \log T}{\epsilon^2} \right)^{v/(1+v)} T^{1/(1+v)} \right)$ を達成し、下界 $\Omega\left( \left(\frac{K}{\epsilon^2} \right)^{v/(1+v)} T^{1/(1+v)} \right)$ と一致する。
- 本稿は、新たなハードインスタンスおよびプライベートでロバストな推定器を構築し、下界の証明に不可欠な役割を果たしており、他のプライベート学習問題への再利用も可能である。
- 実験により理論的結果が確認され、提案されたアルゴリズムがプライバシー制約下でも重たい尾を持つ報酬を効果的に処理でき、DPおよびLDPの両設定でベースライン手法を上回ることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。