Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-preserving Q-Learning with Functional Noise in Continuous State Spaces

Baoxiang Wang, Nidhi Hegde|arXiv (Cornell University)|Jan 30, 2019
Privacy-Preserving Technologies in Data参考文献 40被引用数 5
ひとこと要約

本稿では、連続的状態空間における報酬関数のプライバシーを保護するため、再現核ヒルバート空間(RKHS)を用いて価値関数近似に関数的ノイズを注入することで、微分プライバシーなQ学習アルゴリズムを提案する。ノイズのサンプルパスに対する確率的バウンディングを保証し、反復回数におけるプライバシーの組み合わせを分析することで、任意の状態クエリに対しても劣化のない厳密な$(\epsilon, \delta)$-微分プライバシーを達成する。実験的検証では、既存の手法よりも優れたユーティリティを示した。

ABSTRACT

We consider differentially private algorithms for reinforcement learning in continuous spaces, such that neighboring reward functions are indistinguishable. This protects the reward information from being exploited by methods such as inverse reinforcement learning. Existing studies that guarantee differential privacy are not extendable to infinite state spaces, as the noise level to ensure privacy will scale accordingly to infinity. Our aim is to protect the value function approximator, without regard to the number of states queried to the function. It is achieved by adding functional noise to the value function iteratively in the training. We show rigorous privacy guarantees by a series of analyses on the kernel of the noise space, the probabilistic bound of such noise samples, and the composition over the iterations. We gain insight into the utility analysis by proving the algorithm's approximate optimality when the state space is discrete. Experiments corroborate our theoretical findings and show improvement over existing approaches.

研究の動機と目的

  • 連続的状態空間における報酬関数のプライバシーを保護する微分プライバシーな強化学習アルゴリズムの設計。
  • 価値関数が未訪問の新しい状態でクエリされた場合でも、プライバシー保証が成立することの確認。
  • 反復的強化学習設定において、ニューラルネットワークのような非線形関数近似器への微分プライバシーの拡張。
  • 既存の汎用的定理よりもタイトなプライバシーの組み合わせバウンディングの提供。

提案手法

  • 再現核ヒルバート空間(RKHS)上でのガウス過程メカニズムを用いて、価値関数近似に関数的ノイズを注入する。
  • サンプルパスに対する確率的バウンディングを用いて、ノイズ関数のRKHSノルムを制御し、無限大の状態に対してユニオンバウンディングを回避する。
  • 関数的ノイズメカニズムに特化した新しいプライバシーの組み合わせ解析を適用し、汎用的組み合わせ定理を改善する。
  • 一般的なニューラルネットワークアーキテクチャを埋め込むカーネルを採用し、非線形価値関数近似を可能にする。
  • すべてのノイズパスが所定のノルム閾値内に留まる確率のタイトなバウンディングにより、プライバシーパラメータを導出する。
  • 離散MDP環境を用いた実験により、プライベートなコンテキストバンディットや微分プライバシーなディープラーニング手法を含むベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1価値関数が任意の新しい状態でクエリされた場合、連続的状態空間強化学習において微分プライバシーが厳密に保証可能か?
  • RQ2反復的Q学習において、プライバシーを確保しつつユーティリティを維持する関数的ノイズはどのように設計可能か?
  • RQ3強化学習における関数的ノイズメカニズムのための、最もタイトなプライバシーの組み合わせバウンディングは何か?
  • RQ4提案手法は、ニューラルネットワークのような非線形価値関数近似器に対しても微分プライバシーを保護可能か?
  • RQ5提案手法のユーティリティは、既存の微分プライバシーな強化学習およびバンディットアルゴリズムと比較してどのように異なるか?

主な発見

  • 実験設定において、$\sigma=0.32$で$(\epsilon=0.9, \delta=10^{-4})$-微分プライバシーを達成し、高い信頼性でプライバシー目標を満たした。
  • よりタイトなプライバシー制御のため、$\sigma=0.74$で$(\epsilon=0.45, \delta=10^{-4})$を達成し、低プライバシー予算へのスケーラビリティを示した。
  • ノイズサンプルパスに対する確率的バウンディングは、ナーブなユニオンバウンディングを著しく上回り、よりタイトなプライバシー保証を可能にした。
  • 理論的分析により、離散状態空間において近似的最適性が示された。深層RLの完全な解析が欠如しているものの、ユーティリティの洞察が得られた。
  • 実験的結果では、プライベートなコンテキストバンディットや微分プライバシーなディープラーニング手法を含むベースラインより優れた性能を示した。
  • 本手法は、任意の状態クエリに対してもプライバシーを維持でき、未訪問状態の訪問で失敗する既存手法の主要な制限を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。