Skip to main content
QUICK REVIEW

[論文レビュー] A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms

Shangtong Zhang, Romain Laroche|arXiv (Cornell University)|Oct 2, 2020
Reinforcement Learning in Robotics参考文献 49被引用数 5
ひとこと要約

この論文は、理論的推奨に反して一貫性を欠くが一般的なアクタクリティック強化学習における実践的慣習である、割引付きクリティック($\gamma_{\text{c}} < 1$)を用いながらアクタ更新では割引を無視する($\gamma_{\text{a}} = 1$)方法について検証する。表現学習の観点から、この不一致は、割引なしの設定では望ましいバイアス-バリアンス-表現のトレードオフを可能にし、割引ありの設定では効果的な補助的タスクとして機能することで、性能向上をもたらす。制御された環境における実証的検証が行われている。

ABSTRACT

We investigate the discounting mismatch in actor-critic algorithm implementations from a representation learning perspective. Theoretically, actor-critic algorithms usually have discounting for both actor and critic, i.e., there is a $γ^t$ term in the actor update for the transition observed at time $t$ in a trajectory and the critic is a discounted value function. Practitioners, however, usually ignore the discounting ($γ^t$) for the actor while using a discounted critic. We investigate this mismatch in two scenarios. In the first scenario, we consider optimizing an undiscounted objective $(γ= 1)$ where $γ^t$ disappears naturally $(1^t = 1)$. We then propose to interpret the discounting in critic in terms of a bias-variance-representation trade-off and provide supporting empirical results. In the second scenario, we consider optimizing a discounted objective ($γ&lt; 1$) and propose to interpret the omission of the discounting in the actor update from an auxiliary task perspective and provide supporting empirical results.

研究の動機と目的

  • 理論的推奨に反するが広く用いられている、割引付きクリティック($\\gamma_{\\text{c}} < 1$)を用いながらアクタ更新では割引を無視する($\\gamma_{\\text{a}} = 1$)という実践的慣習の実証的利点を調査すること。
  • 表現学習の観点からこの不一致を理解すること、特にバイアス、バリアンス、表現能力のトレードオフに与える影響を明らかにすること。
  • アクタ更新での割引の省略が、割引ありの目的関数において、ポリシー学習を向上させる有効な補助的タスクとして機能するかどうかを評価すること。
  • 真の目的関数が割引ありの場合に、バイアスありの設定($\\gamma_{\\text{a}} = 1$、$\\gamma_{\\text{c}} < 1$)がバイアスなしの設定($\\gamma_{\\text{a}} = \gamma_{\\text{c}} = \gamma < 1$)を上回る性能を示す実証的証拠を提供すること。

提案手法

  • 著者たちは2つの異なる状況を分析する:(1) 割引なしの目的関数($\gamma = 1$)を最適化する際、$\gamma_{\text{c}} < 1$ を用いる場合、(2) 割引ありの目的関数($\gamma < 1$)を最適化する際、$\gamma_{\text{a}} = 1$、$\gamma_{\text{c}} = \gamma < 1$ を用いる場合。
  • 状況1では、$\gamma_{\text{c}} < 1$ をバイアス、バリアンス、表現学習のバランスを取るメカニズムとして解釈し、固定時間窓TD学習を用いてこれらの効果を分離する。
  • 状況2では、バイアスありとバイアスなしの設定の差を補助的タスクとして位置づけ、表現学習の影響を性能に与える影響を隔離する。
  • 報酬の符号が特定の時刻後に反転するように設計された新しいベンチマーク環境を構築し、不一致に対するロバストネスをテストする。
  • 制御された条件下で、バイアスありの設定($\gamma_{\text{a}} = 1$)とバイアスなしの設定($\gamma_{\text{a}} = \gamma_{\text{c}} = \gamma < 1$)の性能を比較する。
  • 補助的タスクを用いたProximal Policy Optimization(PPO)を用い、不一致が表現学習を向上させることを仮説検証する。

実験結果

リサーチクエスチョン

  • RQ1なぜ割引付きクリティック($\gamma_{\text{c}} < 1$)を用いながらアクタ更新では割引を無視する($\gamma_{\text{a}} = 1$)ことで、割引なしの強化学習設定で性能が向上するのか?
  • RQ2割引ありの目的関数の文脈において、アクタ更新での割引の省略($\gamma_{\text{a}} = 1$)は表現学習にどのように影響するのか?
  • RQ3アクタとクリティックの割引の不一致を、ポリシー学習を強化する有効な補助的タスクとして解釈できるか?
  • RQ4真の目的関数が割引ありの場合に、バイアスありの設定($\gamma_{\text{a}} = 1$、$\gamma_{\text{c}} < 1$)がバイアスなしの設定($\gamma_{\text{a}} = \gamma_{\text{c}} = \gamma < 1$)を上回る性能を示すか?
  • RQ5$\gamma_{\text{a}} = 1$ がもたらすインダクティブバイアスが学習に悪影響を及えるのはどのような条件下か?

主な発見

  • 割引なしの設定($\gamma = 1$)では、$\gamma_{\text{c}} < 1$ を用いることでバリアンスが低減され、表現学習が促進され、バイアスが生じるにもかかわらず性能が向上する。
  • 実証的結果から、$\gamma_{\text{c}} < 1$ が $\gamma_{\text{c}} = 1$ よりも良い表現を学習しやすくする。これはバリアンス低減を超える影響を示している。
  • 割引ありの設定($\gamma < 1$)では、報酬の符号が反転するような分布シフトが生じる環境において、バイアスありの設定($\gamma_{\text{a}} = 1$、$\gamma_{\text{c}} = \gamma < 1$)がバイアスなしの設定を上回る性能を示す。
  • バイアスありの設定での性能向上は、補助的タスク設定によりこの影響を隔離することで確認されたように、改善された表現学習に起因する。
  • インダクティブバイアスが悪影響を及える場合、特に強い分布シフトがある環境では、バイアスなしの設定がより優れた性能を示す。
  • 著者たちは、バイアスありの設定を補助的タスクとして用いるAuxPPOが、インダクティブバイアスの正しさに大きく依存しない、ロバストで効果的な手法であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。