Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Regret of Policy Optimization in Non-stationary Environments

Yingjie Fei, Zhuoran Yang|arXiv (Cornell University)|Jun 30, 2020
Advanced Bandit Algorithms Research参考文献 60被引用数 11
ひとこと要約

本稿では、敵対的報酬と未知の遷移カーネルを伴う非定常環境における強化学習のためのモデルフリー方策最適化アルゴリズムである POWER および POWER++ を提案する。動的リグレットバウンドを確立し、ゆっくり変化する環境では近似的に最適な静的リグレットに適応的に一致させる。リグレットは探索と適応の2つの成分に分解され、POWER++ はアクティブ予測を用いて適応性能を向上させる。

ABSTRACT

We consider reinforcement learning (RL) in episodic MDPs with adversarial full-information reward feedback and unknown fixed transition kernels. We propose two model-free policy optimization algorithms, POWER and POWER++, and establish guarantees for their dynamic regret. Compared with the classical notion of static regret, dynamic regret is a stronger notion as it explicitly accounts for the non-stationarity of environments. The dynamic regret attained by the proposed algorithms interpolates between different regimes of non-stationarity, and moreover satisfies a notion of adaptive (near-)optimality, in the sense that it matches the (near-)optimal static regret under slow-changing environments. The dynamic regret bound features two components, one arising from exploration, which deals with the uncertainty of transition kernels, and the other arising from adaptation, which deals with non-stationary environments. Specifically, we show that POWER++ improves over POWER on the second component of the dynamic regret by actively adapting to non-stationarity through prediction. To the best of our knowledge, our work is the first dynamic regret analysis of model-free RL algorithms in non-stationary environments.

研究の動機と目的

  • 単一の固定方策では不十分な非定常環境における静的リグレットの限界を解消すること。
  • 敵対的フル情報フィードバックを伴う反復的MDPにおいて、変化する報酬関数に適応するモデルフリー方策最適化アルゴリズムを設計すること。
  • 非定常性の異なるスケールにわたる状況をカバーする動的リグレットバウンドを確立すること、特にほぼ定常的な状況を含むこと。
  • 環境の変化が遅い場合に既知の近似的最適な静的リグレットバウンドに一致させることで、適応的近似的最適性を示すこと。
  • 敵対的報酬を伴う非定常環境におけるモデルフリー強化学習アルゴリズムの動的リグレット解析を初めて提供すること。

提案手法

  • 反復的MDPにおいて敵対的報酬と未知の遷移カーネルを伴うモデルフリー方策最適化アルゴリズムとして、POWER および POWER++ を提案する。
  • 動的リグレットを2つの成分に分解する:遷移カーネルの不確実性に起因する探索と、非定常的報酬への適応。
  • 方策最適化プロセスにおいてオンラインミラー降下(OMD)更新を採用し、補題12および補題13を用いたリグレット分解を活用する。
  • POWER++ では、リグレットバウンドの適応成分を向上させるためにアクティブ予測を導入し、報酬の変動への感受性を低減する。
  • パラメータ化された方策更新と信頼区間を正則化項 β を用いて時間窓方式で扱う。
  • パフォーマンス差分バウンドと集中不等式を用いてリグレット項を制御し、α は D_T と L H log A に基づいて適応的に選択される。

実験結果

リサーチクエスチョン

  • RQ1モデルフリー方策最適化は、環境の非定常性の程度に応じて適応する動的リグレットバウンドを達成できるか?
  • RQ2非定常MDPにおける動的リグレットは、定常状態における静的リグレットと比べてどのように異なるか?
  • RQ3リグレット解析において、探索と適応を分離することで、アルゴリズム設計の指針が得られるか?
  • RQ4方策更新におけるアクティブ予測は、変化する報酬関数への適応を向上させるか?
  • RQ5モデルフリー手法を用いて、ゆっくり変化する環境で近似的最適なリグレットを達成することは可能か?

主な発見

  • POWER および POWER++ の動的リグレットは、O~(√(D_T L H log A)) + C τ H² P_T で有界であり、D_T は報酬の変動度、P_T は方策の変動度を測る。
  • ほぼ定常的な環境では、リグレットバウンドは O~(T^{1/2}) に簡略化され、既知の近似的最適な静的リグレットバウンドと一致する。
  • POWER++ は変化を事前に予測するアクティブ予測を用いることで、適応成分を向上させ、報酬の変動への依存度を低減する。
  • リグレット分解により、遷移不確実性に起因する探索(探索成分)と非定常的報酬への適応(適応成分)が明確に分離される。
  • 敵対的報酬を伴う非定常環境におけるモデルフリー強化学習アルゴリズムの動的リグレットバウンドを初めて確立した。
  • バウンドは適応的かつほぼ最適であり、リグレット式に普遍的な定数が含まれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。