Skip to main content
QUICK REVIEW

[論文レビュー] Model-Free Non-Stationary RL: Near-Optimal Regret and Applications in Multi-Agent RL and Inventory Control

Weichao Mao, Kaiqing Zhang|arXiv (Cornell University)|Oct 7, 2020
Advanced Bandit Algorithms Research参考文献 64被引用数 9
ひとこと要約

本稿では、再起動戦略と適応的アバウトネスボーナスを用いて、近似的に最適な動的リグレットを達成する、非定常なエピソード的MDP向けのモデルフリー強化学習アルゴリズムであるRestartQ-UCBを提案する。リグレットバウンドは$ otimes ilde{O}(S^{1/3}A^{1/3} abla^{1/3}HT^{2/3})$であり、情報理論的下界にほぼ一致し、マルチエージェントRLおよびマルチプロダクト在庫制御において優れた計算効率と性能を示す。

ABSTRACT

We consider model-free reinforcement learning (RL) in non-stationary Markov decision processes. Both the reward functions and the state transition functions are allowed to vary arbitrarily over time as long as their cumulative variations do not exceed certain variation budgets. We propose Restarted Q-Learning with Upper Confidence Bounds (RestartQ-UCB), the first model-free algorithm for non-stationary RL, and show that it outperforms existing solutions in terms of dynamic regret. Specifically, RestartQ-UCB with Freedman-type bonus terms achieves a dynamic regret bound of $\widetilde{O}(S^{\frac{1}{3}} A^{\frac{1}{3}} Δ^{\frac{1}{3}} H T^{\frac{2}{3}})$, where $S$ and $A$ are the numbers of states and actions, respectively, $Δ>0$ is the variation budget, $H$ is the number of time steps per episode, and $T$ is the total number of time steps. We further present a parameter-free algorithm named Double-Restart Q-UCB that does not require prior knowledge of the variation budget. We show that our algorithms are \emph{nearly optimal} by establishing an information-theoretical lower bound of $Ω(S^{\frac{1}{3}} A^{\frac{1}{3}} Δ^{\frac{1}{3}} H^{\frac{2}{3}} T^{\frac{2}{3}})$, the first lower bound in non-stationary RL. Numerical experiments validate the advantages of RestartQ-UCB in terms of both cumulative rewards and computational efficiency. We demonstrate the power of our results in examples of multi-agent RL and inventory control across related products.

研究の動機と目的

  • モデルベース手法の非定常強化学習における限界、ならびに高い計算コスト、非効率な探索、分散型マルチエージェント設定との非互換性を解消する。
  • 明示的なモデル推定を必要とせず、非定常なエピソード的MDPにおいて近似的に最適な動的リグレットを達成するモデルフリー手法を開発する。
  • 非定常RLにおける最初の情報理論的下界を確立し、提案手法の最適性を検証する。
  • 分散型マルチエージェントRLおよび動的需要を伴うマルチプロダクト在庫制御といった困難な分野への実用的適用性を示す。
  • 事前に変動予算を知る必要のないパラメータフリーな変種、Double-Restart Q-UCBを設計する。

提案手法

  • 定められた間隔でエージェントの記憶をリセットする再起動戦略を導入し、最近の経験にのみ注目することで、環境の変化の影響を軽減する。
  • Freedman型のボーナス項に、局所的な変動予算に依存する追加の楽観主義的成分を組み込み、非定常性下でも楽観的なQ値推定を保証する。
  • 環境の推定された変動に基づいて動的スケジュールを用いた再起動を実施し、探索と活用のバランスを取る。
  • 状態空間と行動空間を持つエピソード的MDPにアルゴリズムを適用し、環境の遷移関数と報酬関数が時間とともに急激に変化する状況を想定する。
  • 在庫レベルと共同注文意思決定を状態と行動としてモデル化することで、線形MDPおよびマルチプロダクト在庫制御にフレームワークを拡張する。
  • 事前に変動予算を知る必要のないパラメータフリーな変種、Double-Restart Q-UCBを設計し、再起動間隔を自動的に調整可能にする。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーな強化学習アルゴリズムは、モデル推定に依存せずに、非定常なエピソード的MDPにおいて近似的に最適な動的リグレットを達成できるか?
  • RQ2RestartQ-UCBの性能は、既存のモデルベースおよびモデルフリー手法と比較して、リグレットおよび計算効率の面でどのように差をつけるか?
  • RQ3非定常MDPにおける動的リグレットの情報理論的限界は何か? そして、モデルフリー手法はこの限界に近似的に達することができるか?
  • RQ4提案手法は、共同行動観測が得られない分散型マルチエージェントRL設定に効果的に適用可能か?
  • RQ5非定常強化学習は、時間的に変化する需要と容量制約を伴うマルチプロダクト在庫制御を効果的に解けるか?

主な発見

  • RestartQ-UCBは、動的リグレットバウンド$\widetilde{O}(S^{1/3}A^{1/3}\Delta^{1/3}HT^{2/3})$を達成し、情報理論的下界$\Omega(S^{1/3}A^{1/3}\Delta^{1/3}H^{2/3}T^{2/3})$にほぼ一致する。
  • シミュレーションにおいて、累積報酬の面で最先端のモデルベース手法を上回り、計算時間はわずか0.18%にまで削減される。
  • 提案されたDouble-Restart Q-UCBは、事前に変動予算$\Delta$を知る必要がなく、$\Delta$の事前知識なしに同じリグレットバウンドを達成する。
  • 変化の遅い相手を伴うマルチエージェントRLに応用した結果、分散型設定においても高いロバスト性を示した。
  • 倉庫容量制約を伴うマルチプロダクト在庫制御において、状態空間と行動空間を実現可能な在庫および注文組み合わせに基づいて定義することで、同じリグレットバウンドを維持した。
  • 本稿では非定常RLにおける最初の下界を確立し、RestartQ-UCBのリグレットバウンドが$H^{1/3}$要因を除き最適であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。