Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Run with Actor-Critic Ensemble

Zhewei Huang, Shuchang Zhou|arXiv (Cornell University)|Dec 25, 2017
Reinforcement Learning in Robotics参考文献 3被引用数 17
ひとこと要約

この論文では、複数のエージェントが多様な行動を生成し、推論時に最高スコアで安全な行動を選択する批判者アンサンブルを用いることで、Deep Deterministic Policy Gradient (DDPG) を強化する Actor-Critic Ensemble (ACE) を提案する。ACE は、転倒を引き起こす致命的な行動('dooming actions')を低減させ、耐障害性と性能を向上させ、100エピソード中平均報酬39.26、転倒数4回を達成し、DDPGの平均報酬0、転倒数25回を上回った。

ABSTRACT

We introduce an Actor-Critic Ensemble(ACE) method for improving the performance of Deep Deterministic Policy Gradient(DDPG) algorithm. At inference time, our method uses a critic ensemble to select the best action from proposals of multiple actors running in parallel. By having a larger candidate set, our method can avoid actions that have fatal consequences, while staying deterministic. Using ACE, we have won the 2nd place in NIPS'17 Learning to Run competition, under the name of "Megvii-hzwer".

研究の動機と目的

  • DDPGにおける『致命的行動』の問題に対処すること。これは、不安定性により単一のエージェントが元に戻らない転倒を引き起こす行動を選択する場合に生じる。
  • 推論時に多様な候補行動から選択可能にすることで、連続的制御におけるサンプル効率と耐障害性を向上させること。
  • エージェント・批判者フレームワークにおけるアンサンブル学習を検討し、多様なエージェントと批判者を活用して意思決定の質を向上させること。
  • NIPS 2017 Learning to Run 競争で上位2位を獲得する優れた性能を達成すること。

提案手法

  • 異なるハイパーパrameterを用いて、標準的な DDPG を用いて複数のエージェント・批判者ペアを独立して学習させ、多様なエージェントを生成する。
  • 推論時に、複数のエージェントを並列に実行し、同時に行動を提案することで、行動候補集合を拡大する。
  • 批判者アンサンブル(エージェントにペairedされた複数の批判者の出力を平均化)を用い、最高の Q 値を持つ行動を選択評価する。
  • 学習中のベルマン更新を変更し、選択されなかった行動に対してもすべてのエージェントが更新可能になるようにすることで、方策学習の効率を向上させる。
  • Sigmoid より優れた性能を示す実験的結果を得た Scaled Exponential Linear Units (SELU) を活性化関数として採用する。
  • 学習を加速させ、長時間スケールのタスクにおける勾配消失問題を軽減するため、より大きなシミュレーションタイムステップ(4倍)を採用する。

実験結果

リサーチクエスチョン

  • RQ1エージェントと批判者のアンサンブルを用いることで、致命的行動を回避し、連続的制御における耐障害性が向上するか?
  • RQ2多様なエージェントと批判者を用いることで、同種または単一方策の DDPG よりも優れた性能が得られるか?
  • RQ3推論時に多様な候補行動から選択することで、長時間スケールの移動タスクにおける転倒率が顕著に低下するか?
  • RQ4標準的な DDPG と比較して、アンサンブルベースの行動選択は、平均および最大エピソード報酬においてどのように異なるか?

主な発見

  • 10エージェントと10批判者を用いた ACE(A10C10)は、平均報酬39.2579を達成し、DDPG(A1C0)の32.0789を著しく上回った。
  • 転倒数は A1C0 の25回から A10C10 の4回に減少し、耐障害性の向上が明確に示された。
  • 最大エピソード報酬は A1C0 の41.4203から A10C10 の41.9507に上昇し、性能の上限が向上したことが示された。
  • 同一またはエポックベースのモデルと比較して、多様なエージェントと批判者を用いることで性能が向上した。これはアンサンブルの多様性の利点を支持する。
  • トレーニング時の ACE と推論時の ACE で類似した性能が得られたため、トレーニングと推論の両方で安定した方策学習が実現した。
  • SELU 活性化関数は、ReLU、Leaky ReLU、Tanh、Sigmoid と比較して、学習安定性および最終的性能の両面で優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。