Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning with Robust and Smooth Policy

Qianli Shen, Yan Li|arXiv (Cornell University)|Mar 21, 2020
Reinforcement Learning in Robotics参考文献 29被引用数 16
ひとこと要約

本稿では、小さな入力摂動に対して出力の変化を抑えることで、深層強化学習方策の滑らかさを強制する新しい正則化フレームワークSR²Lを提案する。TRPOおよびDDPGに滑らかさ正則化を統合することで、追加の敵対的訓練を必要とせず、サンプル効率、学習安定性、状態空間のノイズおよび敵対的摂動に対する耐性が向上する。

ABSTRACT

Deep reinforcement learning (RL) has achieved great empirical successes in various domains. However, the large search space of neural networks requires a large amount of data, which makes the current RL algorithms not sample efficient. Motivated by the fact that many environments with continuous state space have smooth transitions, we propose to learn a smooth policy that behaves smoothly with respect to states. We develop a new framework -- extbf{S}mooth extbf{R}egularized extbf{R}einforcement extbf{L}earning ($ extbf{SR}^2 extbf{L}$), where the policy is trained with smoothness-inducing regularization. Such regularization effectively constrains the search space, and enforces smoothness in the learned policy. Moreover, our proposed framework can also improve the robustness of policy against measurement error in the state space, and can be naturally extended to distribubutionally robust setting. We apply the proposed framework to both on-policy (TRPO) and off-policy algorithm (DDPG). Through extensive experiments, we demonstrate that our method achieves improved sample efficiency and robustness.

研究の動機と目的

  • 深層強化学習における、ニューラルネットワークの高次元的かつ複雑な探索空間に起因する低いサンプル効率および不安定性を是正すること。
  • 現実世界の環境で一般的に見られる状態測定誤差および敵対的摂動に対する方策の耐性を向上させること。
  • パフォーマンスを損なわず、ドメイン固有の事前知識を必要としない、柔軟な正則化フレームワークを構築すること。
  • 滑らかさ正則化が、オンポリシーおよびオフポリシーRLアルゴリズムにおいて、サンプル効率および耐性の両方を自然に向上させることを実証すること。

提案手法

  • 局所リプシッツ感度に基づき、状態入力の小さな変化に対して方策出力の大きな変化をペナルティ化する滑らかさ誘導正則化項を導入する。
  • TRPO(オンポリシー)では方策ネットワークに、DDPG(オフポリシー)では方策またはQ関数に正則化を直接適用し、滑らかさを強制する。
  • ロバスト統計における局所シフト感度測定を、方策の滑らかさの代理指標として用い、効果的に方策ネットワークの探索空間を制約する。
  • 評価時に、反復的勾配上昇法を用いて敵対的摂動を生成し、状態摂動下での耐性をテストする。
  • 標準的なRLアルゴリズムと互換性があるように正則化を設計し、既存の学習パイプラインへの即時統合を可能にする。
  • 滑らかさが誘導する内在的耐性を活用することで、分布的ロバストな設定へのフレームワークの拡張を図る。

実験結果

リサーチクエスチョン

  • RQ1方策ネットワークにおける滑らかさの強制は、深層強化学習におけるサンプル効率の向上に寄与するか?
  • RQ2滑らかさ正則化は、連続制御タスクにおけるランダムおよび敵対的状態摂動に対して、耐性を向上させるか?
  • RQ3提案された正則化は、オンポリシー(TRPO)およびオフポリシー(DDPG)の両方の深層RLアルゴリズムに効果的に適用可能か?
  • RQ4滑らかさ正則化は、複数のランダムシードにわたる学習の安定性および最悪ケース性能の向上をもたらすか?
  • RQ5敵対的例に対する明示的訓練なしに、滑らかさ正則化が耐性の代理指標として機能するか?

主な発見

  • MuJoCo環境において、TRPO-SRとDDPG-SRは、すべての報酬パーセンタイルでベースラインを一貫して上回り、最悪ケースおよび最良ケース性能の両方の向上を示している。
  • SwimmerおよびHalfCheetahにおいて、TRPO-SRは最悪ケース性能が著しく優れており、同時に競争力のある最良ケース性能を維持しており、初期化のばらつきに対する耐性が確認された。
  • 状態摂動(ランダムおよび敵対的)が増加する条件下でも、TRPO-SRの累積報酬の低下がTRPOより遅く、耐性の向上が示された。
  • DDPG-SR-AおよびDDPG-SR-Cは、大規模な摂動レベル下でも耐性および安定性に類似した改善を示し、分散が低減された。
  • 滑らかさ正則化により、目標パフォーマンスに到達するまでの環境ステップ数を30〜50%削減し、サンプル効率が向上した。
  • 明示的な敵対的訓練を一切行わずに耐性が向上したため、滑らかさが状態空間の摂動に対して暗黙の正則化として機能することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。