Skip to main content
QUICK REVIEW

[論文レビュー] Balancing Constraints and Rewards with Meta-Gradient D4PG

Dan A. Calian, Daniel J. Mankowitz|arXiv (Cornell University)|Oct 13, 2020
Reinforcement Learning in Robotics参考文献 27被引用数 6
ひとこと要約

本稿では、連続的制御強化学習における期待報酬の最大化と制約違反の最小化のトレードオフを改善するメタ勾配に基づく手法MetaLを提案する。D4PGフレームワーク内でのメタ勾配の活用により、MetaLはラグランジュ乗数を動的に最適化し、4つのMuJoCo環境において、報酬、ペナルティ付き報酬、制約遵守の観点で、統計的に有意な向上を達成した。

ABSTRACT

Deploying Reinforcement Learning (RL) agents to solve real-world applications often requires satisfying complex system constraints. Often the constraint thresholds are incorrectly set due to the complex nature of a system or the inability to verify the thresholds offline (e.g, no simulator or reasonable offline evaluation procedure exists). This results in solutions where a task cannot be solved without violating the constraints. However, in many real-world cases, constraint violations are undesirable yet they are not catastrophic, motivating the need for soft-constrained RL approaches. We present a soft-constrained RL approach that utilizes meta-gradients to find a good trade-off between expected return and minimizing constraint violations. We demonstrate the effectiveness of this approach by showing that it consistently outperforms the baselines across four different MuJoCo domains.

研究の動機と目的

  • 制約がソフトであり、閾値が明確でないか不切な状況がしばしば生じる実世界のシステムへのRLエージェントの導入という課題に対処すること。
  • 硬直的な制約を課すのでなく、期待報酬の最大化と制約違反の最小化の最適なトレードオフを見つける手法を開発すること。
  • ハイパーパramータの選択に敏感でないよう、既存の制約付きRL手法を改善するため、メタ勾配を用いてラグランジュ乗数を自動的にチューニングすること。
  • MuJoCo環境における実験的評価を通じて、ソフト制約付きRLにおけるメタ勾配最適化の有効性を示すこと。

提案手法

  • MetaLは、報酬目的と制約違反の最適なトレードオフを学習するために、D4PGアルゴリズムにメタ勾配を拡張する。
  • 制約付き強化学習問題をネストされた最適化問題として定式化し、外側の目的関数は制約違反の最小化と報酬の最大化を同時に最適化する。
  • この手法は、ポリシーと価値関数の更新プロセスを内側の最適化として扱い、その内部プロセスを逆伝播することでラグランジュ乗数をメタ勾配で更新する。
  • 制約違反の微分可能近似を用いてエンドツーエンドで学習することで、トレードオフのハイパーパramータを勾配ベースで最適化可能となる。
  • 固定報酬形状(RS)と報酬制約付きD4PG(RC-D4PG)のベースラインと比較する。
  • MetaLは、メタ勾度を用いて報酬形状を強化した第二のバリエーション、MeShを導入し、制約処理のさらなる改善を図る。

実験結果

リサーチクエスチョン

  • RQ1連続的制御強化学習において、報酬最大化と制約違反最小化の動的トレードオフを学習するために、メタ勾配が有効に利用可能か?
  • RQ2MetaLは、固定ハイパーパramータベースラインおよびRC-D4PGと比較して、さまざまな制約閾値において、性能とロバストネスの点で優れているか?
  • RQ3既存の制約付きRL手法と比較して、MetaLは初期学習率の設定に敏感でないか?
  • RQ4メタ勾配に基づく最適化は、実世界のRL応用において期待報酬を犠牲にせずに制約遵守を改善できるか?
  • RQ5MetaLの性能向上は、複数のMuJoCo環境において統計的に有意か?

主な発見

  • MetaLは、報酬とペナルティ付き報酬の両面で、4つのMuJoCoドメインのうち3つにおいて、最良の報酬形状ベースライン(RS-0.1)を顕著に上回った。
  • MetaLは、すべてのドメインですべてのベースラインを統計的に有意に上回り、すべての性能指標についてp値が1e-09未満であった。
  • Walker環境では、MetaLは報酬851.10 ± 30.55、ペナルティ付き報酬912.97を達成し、RC-D4PGおよびRS-1.0を上回った。
  • 四足歩行環境では、MetaLは報酬828.21 ± 19.73、制約超過0.17を達成し、RC-D4PGの0.13およびD4PGの0.35を顕著に上回った。
  • 最適な学習率(α₁ = 0.001)で動作するRC-D4PGと比較して、サブオプティマルな学習率(α₁ = 0.005)でもMetaLは優れた性能と制約遵守を維持した。
  • MetaLは、すべてのテスト済みの固定初期学習率において、RC-D4PGを一貫して上回り、ハイパーパramータ選択に対するロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。