Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning with Decorrelation

Borislav Mavrin, Hengshuai Yao|arXiv (Cornell University)|Mar 18, 2019
Reinforcement Learning in Robotics参考文献 25被引用数 7
ひとこと要約

本論文は、損失関数に相関ペナルティを追加することで、深層強化学習(DRL)における特徴の相関を低減する、シンプルでありながら効果的な正則化手法を提案する。DQNおよびQuantile Regression DQN(QR-DQN)における特徴の相関を低減することで、学習効率と性能が向上し、49のAtariゲームにおいて70%のヒューマン正規化スコアを達成。標準DQN比で40%の向上を示し、39ゲームで顕著な向上を示し、6ゲームでのわずかな損失にとどまる。

ABSTRACT

Learning an effective representation for high-dimensional data is a challenging problem in reinforcement learning (RL). Deep reinforcement learning (DRL) such as Deep Q networks (DQN) achieves remarkable success in computer games by learning deeply encoded representation from convolution networks. In this paper, we propose a simple yet very effective method for representation learning with DRL algorithms. Our key insight is that features learned by DRL algorithms are highly correlated, which interferes with learning. By adding a regularized loss that penalizes correlation in latent features (with only slight computation), we decorrelate features represented by deep neural networks incrementally. On 49 Atari games, with the same regularization factor, our decorrelation algorithms perform $70\%$ in terms of human-normalized scores, which is $40\%$ better than DQN. In particular, ours performs better than DQN on 39 games with 4 close ties and lost only slightly on $6$ games. Empirical results also show that the decorrelation method applies to Quantile Regression DQN (QR-DQN) and significantly boosts performance. Further experiments on the losing games show that our decorelation algorithms can win over DQN and QR-DQN with a fined tuned regularization factor.

研究の動機と目的

  • DRLで使用される深層ニューラルネットワークにおける高次元特徴相関の問題に取り組み、学習効率と性能の向上を図ること。
  • 補助タスクや経験リプレイに依存せず、1段階でエンドツーエンドに効果的な表現を学習し、制御タスクを同時に解ける方法を開発すること。
  • 学習された潜在的特徴間の相関を明示的に低減することで、DQNおよびQR-DQNの一般化性能と安定性を向上させること。
  • 相関除去手法が、QR-DQNのような分布的RLアルゴリズムを含む、さまざまなDRLアーキテクチャに一般化可能かどうかを検証すること。
  • 特定のゲームで性能が劣化するのは、ハイパーパrameterの選択が不適切であるためであり、手法自体の限界によるものではないかを調査すること。

提案手法

  • 深層ニューラルネットワークの隠れ層における特徴間の平均二乗相関をペナルティ化する正則化損失関数を導入する。
  • 最終畳み込み層の活性化から特徴共分散行列を計算し、非対角成分の二乗和に比例する正則化項を適用する。
  • 標準DQNまたはQR-DQN損失に相関ペナルティ項を追加し、正則化強度を制御するハイパーパrameter λ を用いる。
  • 確率的勾配降下法を用いて、予測精度と特徴の相関除去を同時に促進する組み合わせ損失関数をエンドツーエンドで学習する。
  • 一般化を評価するために、49のAtariゲームすべてに同じ正則化係数 λ を適用する。また、成績が悪かったゲームでは λ を微調整して性能を向上させる。
  • QR-DQNに対しても同じ相関除去メカニズムを適用し、さまざまなDRLアルゴリズム間での適用可能性を示す。

実験結果

リサーチクエスチョン

  • RQ1DRLの表現における特徴間の高い相関が、学習性能を低下させ、収束を遅くするのか?
  • RQ2特徴相関をペナルティ化するシンプルで微分可能な正則化項が、多様な環境においてDQN性能を顕著に向上させられるか?
  • RQ3相関除去手法は、QR-DQNのような分布的RLの変種にも一般化可能か?
  • RQ4特定のAtariゲームで性能が低下するのは、正則化ハイパーパrameterの選択が不適切であるためであり、手法自体の失敗によるものではないか?
  • RQ5相関が低い特徴は、DRLモデルにおいてより解釈可能または冗長性の低い表現をもたらすのか?

主な発見

  • 相関除去手法により、DQNの性能は70%のヒューマン正規化スコアに向上し、49のAtariゲーム全体で標準DQN比で40%の相対的向上を達成した。
  • 39ゲームでは、相関除去DQN(DQN-decor)が標準DQNを上回り、4ゲームは同等の結果を示し、わずか6ゲームでのみわずかな性能低下が見られた。
  • QR-DQNへの適用では、中央値のヒューマン正規化スコアが顕著に向上し、34ゲーム(累積報酬で5%以上上回る)で勝利、5ゲームで敗北、10ゲームで接近した結果となった。
  • 成績が悪かったゲームの性能低下は、不適切な正則化係数の選択に起因しており、λ の微調整により強力な性能が回復した。これは、手法の頑健性を示している。
  • 特徴共分散分析の結果、DQN-decorは標準DQNと比較して非対角成分の相関の絶対値が著しく低く、冗長な特徴の活性化が少ないことが明らかになった。
  • 可視化の結果、DQN-decorは1フレームあたり同時に活性化される特徴が少ないことが示され、よりスパースで明確な表現が得られている可能性があり、解釈性の向上が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。