Skip to main content
QUICK REVIEW

[論文レビュー] DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization

Aviral Kumar, Rishabh Agarwal|arXiv (Cornell University)|Dec 9, 2021
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、確率的勾配降下法(SGD)における暗黙の正則化が、オフライン設定における価値ベースの深層強化学習(RL)を損なう要因であることを特定し、特徴の共適応と表現のアリス(aliasing)を引き起こしていると指摘している。これを是正するため、連続する状態行動ペアの特徴間の類似性をペナルティ化するシンプルな明示的正則化手法DR3を提案している。DR3は、Atari、D4RL、ロボット操作タスクのベンチマークにおいて、性能と安定性を顕著に向上させている。

ABSTRACT

Despite overparameterization, deep networks trained via supervised learning are easy to optimize and exhibit excellent generalization. One hypothesis to explain this is that overparameterized deep networks enjoy the benefits of implicit regularization induced by stochastic gradient descent, which favors parsimonious solutions that generalize well on test inputs. It is reasonable to surmise that deep reinforcement learning (RL) methods could also benefit from this effect. In this paper, we discuss how the implicit regularization effect of SGD seen in supervised learning could in fact be harmful in the offline deep RL setting, leading to poor generalization and degenerate feature representations. Our theoretical analysis shows that when existing models of implicit regularization are applied to temporal difference learning, the resulting derived regularizer favors degenerate solutions with excessive "aliasing", in stark contrast to the supervised learning case. We back up these findings empirically, showing that feature representations learned by a deep network value function trained via bootstrapping can indeed become degenerate, aliasing the representations for state-action pairs that appear on either side of the Bellman backup. To address this issue, we derive the form of this implicit regularizer and, inspired by this derivation, propose a simple and effective explicit regularizer, called DR3, that counteracts the undesirable effects of this implicit regularizer. When combined with existing offline RL methods, DR3 substantially improves performance and stability, alleviating unlearning in Atari 2600 games, D4RL domains and robotic manipulation from images.

研究の動機と目的

  • 過パラメータ化されているにもかかわらず、オフライン設定における学習過程で価値ベースの深層RL手法が性能を低下させる理由を調査すること。
  • 時系列差分学習におけるSGDの暗黙の正則化効果と、それが特徴表現に与える悪影響を分析すること。
  • オフライン深層RLにおける性能低下の主な要因として、特徴の共適応と表現のアリスを同定すること。
  • 元のRLアルゴリズムを変更せずに、実用的で理論的根拠を持つ正則化手法を開発すること。
  • DR3が多様なオフラインRLベンチマークにおいて性能と安定性を向上させることを実証的に検証すること。

提案手法

  • 理論的分析により、TD学習におけるSGDが誘導する暗黙の正則化を導出し、Bellmanバックアップにおいて特徴の類似度が高い退化解を好むことを示した。
  • 実験的分析により、連続する状態行動特徴間のドット積類似度で測定される特徴の共適応が、性能低下と相関していることを示した。
  • 時間的に隣接する状態行動ペアの特徴間の類似度をペナルティ化する、実装可能な明示的正則化手法DR3を設計した。
  • ブートストラップ更新において、連続する遷移からの特徴間のコサイン類似度を最小化することで、訓練中に正則化を適用した。
  • DR3は、CQL、REM、BRACなどの既存のオフラインRLアルゴリズムと互換性があり、アーキテクチャの変更なしに容易に統合可能である。
  • 実験では、Atari 2600ゲーム、D4RL環境、画像ベースのロボット操作タスクを用いて、標準的なオフラインRLベンチマークでDR3の有効性を評価した。

実験結果

リサーチクエスチョン

  • RQ1教師あり学習では有益であるとされるSGDの暗黙の正則化が、オフライン設定における価値ベースの深層RLに対しても有益であるか?
  • RQ2深層ネットワークを用いたTD学習において生じる暗黙の正則化の形式は何か?
  • RQ3この暗黙の正則化が、退化した特徴表現と性能低下を引き起こすメカニズムは何か?
  • RQ4明示的正則化が、この暗黙の正則化の悪影響を是正できるか?
  • RQ5DR3は多様なオフラインRLベンチマークにおいて性能と安定性を向上させるか?

主な発見

  • DR3は、最も挑戦的なD4RLタスクにおいて、ベースラインのオフラインRL手法比で60%の性能向上を達成した。
  • 17種類のAtari 2600ゲームにおいて、DR3はREMで平均160%の安定性向上、CQLで25%の安定性向上を達成した(訓練イテレーション全体における平均性能で測定)。
  • DR3を適用することで、特徴のドット積類似度が顕著に低下し、共適応が減少し、訓練全体にわたり低値に安定した。
  • DR3は特徴表現におけるランク崩壊を防止した。これは、オフラインRLにおける性能低下と相関する既知の病理的現象である。
  • 画像ベースのロボット操作タスクにおいても性能向上を示し、ピクセルベースの環境を超えた一般化能力を示した。
  • Q値の過大評価が生じない状況でも、DR3を適用しない長時間の訓練は、特徴の共適応の増加に伴い性能低下を引き起こすことが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。