[論文レビュー] Local Differential Privacy for Regret Minimization in Reinforcement Learning
本稿は、送信前のユーザーデータの機密化にシャッフルドローカルメカニズムを用いることで、有限時 horizon の強化学習におけるローカル微分プライバシー(LDP)下でのレジームンティミニマイゼーションのための最初のアルゴリズムを提案する。レジームンティの下界を Ω(H√(SAK)/min{e^ε−1,1}) として確立し、√K/ε のレジームンティを達成する「LDP-OBI」というオプティミスティックなアルゴリズムを提示。この下界と一致する K および ε 依存性を有する。
Reinforcement learning algorithms are widely used in domains where it is desirable to provide a personalized service. In these domains it is common that user data contains sensitive information that needs to be protected from third parties. Motivated by this, we study privacy in the context of finite-horizon Markov Decision Processes (MDPs) by requiring information to be obfuscated on the user side. We formulate this notion of privacy for RL by leveraging the local differential privacy (LDP) framework. We establish a lower bound for regret minimization in finite-horizon MDPs with LDP guarantees which shows that guaranteeing privacy has a multiplicative effect on the regret. This result shows that while LDP is an appealing notion of privacy, it makes the learning problem significantly more complex. Finally, we present an optimistic algorithm that simultaneously satisfies $\\varepsilon$-LDP requirements, and achieves $\\sqrt{K}/\\varepsilon$ regret in any finite-horizon MDP after $K$ episodes, matching the lower bound dependency on the number of episodes $K$.
研究の動機と目的
- ローカル微分プライバシー(LDP)が有限時 horizon のマルコフ決定過程(MDP)におけるレジームンティミニマイゼーションに与える影響を調査すること。
- RLの設定において、ε-LDP制約下でのレジームンティの理論的下界を確立すること。
- ε-LDPを満たしつつ、有限時 horizon のMDPにおけるレジームンティを最小化するアルゴリズムを設計・分析すること。
- LDPが、共同微分プライバシー(JDP)と比較して、レジームンティに乗法的コストをもたらすことを示すこと。
提案手法
- 送信前のユーザーの状態-行動-報酬軌道を機械的に機械的応答メカニズムに基づくローカルランダマイザー R_p^0/1 を用いて機密化する。
- プライバシー強化のためのシャッフルメカニズムを採用し、集計統計に (ε, δ)-DP を確保する。
- 機密化されたデータを用いて、状態-行動訪問回数、遷移確率、累積報酬の不偏推定器を構築する。
- プライバシーに配慮した信頼区間を組み込んだ、オプティミスティックな値反復法(LDP-OBI)を用い、探索とプライバシーのバランスを取る。
- Cheuら(2019)のシャッフルプライバシーに関する結果を用いて、機密化されたカウンタの高確率集中限界を導出する。
- プライバシーパラメータ ε を時 horizon H でスケーリングすることで、ローカルメカニズムに対して Hε-LDP を得るプライバシー強化技術を用いる。
実験結果
リサーチクエスチョン
- RQ1有限時 horizon の強化学習において、LDPによるプライバシーとレジームンティの根本的トレードオフは何か?
- RQ2ユーザーのデータに対して ε-LDP を満たしつつ、サブラインアーレジームンティを達成できるRLアルゴリズムは存在するか?
- RQ3同じ設定において、LDP下のレジームンティは、共同微分プライバシー(JDP)下のものと比較してどう異なるか?
- RQ4LDP下で、レジームンティがエピソード数 K およびプライバシーパラメータ ε に対して最適な依存関係は何か?
- RQ5LDPを満たしつつ、近似的に最適なレジームンティを達成できる実用的アルゴリズムを設計できるか?
主な発見
- 本稿は、有限時 horizon のMDPにおける ε-LDP に対して、Ω(H√(SAK)/min{e^ε−1,1}) のレジームンティ下界を確立し、プライバシーがレジームンティに乗法的コストをもたらすことを示した。
- 提案された LDP-OBI アルゴリズムは、√K/ε のレジームンティを達成し、下界の K および ε 依存性を対数要因を除き一致する。
- レジームンティの境界は H²S²A√(KH)/(e^(ε/H)−1) に比例し、ε が小さくなる(より強いプライバシー)ほど性能が著しく低下することが示された。
- シャッフルメカニズムによりプライバシー強化が可能となり、ローカルプライバシーを満たすにもかかわらず、集計統計に (ε_k,c, δ₀)-DP を達成できる。
- 本手法は、各ユーザーのデータがソースで機密化されることを保証し、ε-LDP を満たす一方で、不偏推定を用いて効果的な学習を可能にする。
- 分析から、LDP は RL において JDP より本質的に困難であることが示された。LDP では加法的ではなく乗法的なレジームンティペナルティが必要となる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。