Skip to main content
QUICK REVIEW

[論文レビュー] Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning

Sajad Khodadadian, Pranay Sharma|arXiv (Cornell University)|Jun 21, 2022
Privacy-Preserving Technologies in Data被引用数 13
ひとこと要約

本稿では、マルコフ的ノイズと複数回のローカル更新を想定した条件下で、エージェント数に関して線形収束速度向上を達成する、オンポリシーTD、オフポリシーTD、Q学習のためのフェデレーテッド強化学習アルゴリズムを提案する。本稿は、現実的であるマルコフ的設定におけるこれらのアルゴリズムの収束解析を初めて確立し、線形速度向上を証明するとともに、通信頻度の影響を特定する。

ABSTRACT

Since reinforcement learning algorithms are notoriously data-intensive, the task of sampling observations from the environment is usually split across multiple agents. However, transferring these observations from the agents to a central location can be prohibitively expensive in terms of communication cost, and it can also compromise the privacy of each agent's local behavior policy. Federated reinforcement learning is a framework in which $N$ agents collaboratively learn a global model, without sharing their individual data and policies. This global model is the unique fixed point of the average of $N$ local operators, corresponding to the $N$ agents. Each agent maintains a local copy of the global model and updates it using locally sampled data. In this paper, we show that by careful collaboration of the agents in solving this joint fixed point problem, we can find the global model $N$ times faster, also known as linear speedup. We first propose a general framework for federated stochastic approximation with Markovian noise and heterogeneity, showing linear speedup in convergence. We then apply this framework to federated reinforcement learning algorithms, examining the convergence of federated on-policy TD, off-policy TD, and $Q$-learning.

研究の動機と目的

  • 現実的であるマルコフ的サンプリングとローカル更新を想定した条件下で、フェデレーテッド強化学習における線形収束速度向上を達成する課題に対処すること。
  • 非i.i.d.なマルコフ的ノイズ下での線形関数近似を用いたフェデレーテッドTD学習とQ学習を分析すること。
  • エージェント数と同期頻度Kの両方を考慮した収束バウンドを確立すること。
  • マルコフ的ノイズ下でのフェデレーテッド確率的近似の包括的理論枠組みを構築すること。
  • フェデレーテッドRLにおける通信効率と収束スケーリングに関する未解決の問いを解消すること。

提案手法

  • エージェントがオンポリシーのサンプルを用いてローカルモデルを更新し、モデルパラメータのみを共有する、線形関数近似を用いたフェデレーテッドオンポリシーTD学習を提案する。
  • 行動方策が目標方策とは異なる場合でもプライバシーを保持できる、フェデレーテッドオフポリシーTDおよびQ学習アルゴリズムを導入する。
  • マルコフ的ノイズ下でのフェデレーテッド確率的近似の一般枠組みを構築し、統一的な収束解析を可能にする。
  • 非i.i.d.データに対処するため、重み付きノルムとリャプノフ関数を組み合わせた、新しい解析技法(FedSAMアルゴリズムに基づく)を用いる。
  • 通信頻度K、ステップサイズα、混合時間τの影響を分析することで収束バウンドを導出する。
  • pノルムのノルム同値性と滑らかさの性質を用い、状態空間サイズ|S|、割引因子γ、最小状態訪問確率μ_minの観点から収束速度の上限を評価する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドRLでNewAエージェントを使用することで、マルコフ的サンプリング下で収束にN倍の線形速度向上が得られるか?
  • RQ2同期頻度KがフェデレーテッドQ学習およびTD学習の収束速度と最終誤差に与える影響は何か?
  • RQ3i.i.d.ノイズの仮定とは異なり、マルコフ的ノイズと複数回のローカル更新のもとでも線形速度向上を確立できるか?
  • RQ4通信頻度Kは、フェデレーテッドRLにおける収束速度と通信コストのバランスを取るために果たす役割は何か?
  • RQ5マルコフ的ノイズ下で複数のフェデレーテッドRLアルゴリズムの収束を分析する包括的理論枠組みを構築できるか?

主な発見

  • 本稿は、マルコフ的ノイズ下でのフェデレーテッドTDおよびQ学習に対して、エージェント数に関して線形収束速度向上を証明した。これは、以前の研究では確立されていなかった結果である。
  • 収束速度は時間tに関してO(1/t)のスケーリングを示し、定数因子はエージェント数に比例して改善される。
  • 解析により、同期頻度Kを増やすことで収束が改善されるが、ある点を過ぎると効果が鈍り、限界効果が現れることが示された。
  • 収束バウンドはμ_min(1−γ)に依存しており、混合が悪いマルコフ連鎖では学習が遅くなることが示された。
  • Corollary B.1.1を用いてサンプル複雑性を導出し、エージェント数の増加に伴い、混合時間の逆数に比例して良好にスケーリングされることが示された。
  • フレームワークにより、フェデレーテッドQ学習およびTD学習が、マルコフ的ノイズ下での一般フェデレーテッド確率的近似アルゴリズムの特別なケースであることが確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。