Skip to main content
QUICK REVIEW

[論文レビュー] Return-Based Contrastive Representation Learning for Reinforcement Learning

Guoqing Liu, Chuheng Zhang|arXiv (Cornell University)|Feb 22, 2021
Reinforcement Learning in Robotics参考文献 46被引用数 18
ひとこと要約

本論文は、報酬信号を用いて、類似した報酬を持つ状態行動ペアと異なる報酬を持つペアを区別できるように表現を学習する、深層強化学習における新たな対照的補助タスクであるReturn-Based Contrastive Representation Learning(RCRL)を提案する。RCRLは、AtariおよびDMControlベンチマークにおける低データ環境下で、サンプル効率と性能を向上させ、強力なベースラインを上回り、既存の手法と相乗効果を発揮する。

ABSTRACT

Recently, various auxiliary tasks have been proposed to accelerate representation learning and improve sample efficiency in deep reinforcement learning (RL). However, existing auxiliary tasks do not take the characteristics of RL problems into consideration and are unsupervised. By leveraging returns, the most important feedback signals in RL, we propose a novel auxiliary task that forces the learnt representations to discriminate state-action pairs with different returns. Our auxiliary loss is theoretically justified to learn representations that capture the structure of a new form of state-action abstraction, under which state-action pairs with similar return distributions are aggregated together. In low data regime, our algorithm outperforms strong baselines on complex tasks in Atari games and DeepMind Control suite, and achieves even better performance when combined with existing auxiliary tasks.

研究の動機と目的

  • 低データ環境下における深層強化学習のサンプル非効率性を解消するために、報酬に注意を向けた補助タスクを導入すること。
  • 報酬分布に基づく新しい状態行動抽象化の構造を捉える理論的根拠に基づいた表現学習手法を開発すること。
  • 報酬に依存しない特徴に対して不変であるが、報酬に依存する違いは保持するように表現を学習することで、方策学習を改善すること。
  • 報酬に基づく対照的学習が、既存の非教師付き対照的手法と効果的に組み合わせられ、さらなる性能向上をもたらすことを示すこと。

提案手法

  • RCRLは、報酬の類似性に基づいてポジティブおよびネガティブなサンプルを構築する:ポジティブペアは同じまたは類似した報酬を持つ、ネガティブペアは異なる報酬を持つ。
  • モーメンタムエンコーダーと予測ヘッドを用いて、ポジティブおよびネガティブな状態行動表現を区別する対照的損失を学習する。
  • 本手法は、方策πにおける報酬分布が類似する状態行動ペアをグループ化する、新規の状態行動抽象化Z^π-irrelevanceを活用する。
  • Z^π-irrelevanceを完全な報酬分布ではなく、サンプリングされた報酬を用いて近似するZ学習が提案され、実用的な学習を可能にする。
  • 等しい重みと共有された学習率を用いて、主なRLアルゴリズム(例:Rainbow, SAC)と補助損失を統合することで、ハイパーパrameterへの感受性を低減する。
  • ポジティブペアは、軌道内の連続するセグメントから収集され、報酬の類似性を保証する。ネガティブペアはリプレイメモリからランダムにサンプリングされる。

実験結果

リサーチクエスチョン

  • RQ1報酬に基づく対照的学習は、深層強化学習における表現品質とサンプル効率を向上させることができるか?
  • RQ2提案されたZ^π-irrelevance抽象化は、Q値の正確性を保持しながら、状態行動空間の有効なサイズを小さくするか?
  • RQ3RCRLは、AtariおよびDMControl環境における強力なベースラインと比較して、低データ環境下でどのように性能を発揮するか?
  • RQ4RCRLは、既存の非教師付き対照的手法と効果的に組み合わせられ、さらなる性能向上をもたらすか?

主な発見

  • RCRLは、低データ環境(100kの相互作用)下で55種類のAtariゲームのうち53種類で強力なベースラインを上回り、中央値として182.4%のヒューマン正規化スコアを達成した。
  • DMControlスイートでは、RCRLはベースラインよりも優れた性能を発揮し、複雑な連続的制御タスクで顕著な向上を示した。
  • 高データ環境(150万の相互作用)下でも、RCRLは5つのAtariゲームのうち4つでベースラインを上回った。これは、広範な適用可能性を示している。
  • 表現分析の結果、RCRLは類似した報酬分布が類似した埋め込みを生成し、異なる報酬が異なる埋め込みを生成するように表現を学習していることが判明し、一般化の加速に寄与している。
  • 本手法はハイパーパrameterチューニングに対して頑健であり、補助タスクと主なRLタスクの両方に等しい損失重みと学習率を用いても、性能の低下が生じない。
  • CURLと組み合わせた場合、RCRLはさらに優れた性能を発揮し、既存の非教師付き対照的手法との相性と相乗効果を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。