Skip to main content
QUICK REVIEW

[論文レビュー] RRL: Resnet as representation for Reinforcement Learning

Rutav Shah, Vikash Kumar|arXiv (Cornell University)|Jul 7, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

RRLは、カメラやジョイントセンサなどの本体センサからの入力のみを用いて、事前学習済みResNet特徴量を強化学習における視覚的表現として使用することを提案する。事前学習済みImageNetで学習されたResNet-34エンコーダーを固定することで、完全な状態情報を利用した最先端手法と同等の性能を達成し、特に接触が豊富な複雑な操作タスク(例:Adroit Manipulation)において優れた性能を発揮する。

ABSTRACT

The ability to autonomously learn behaviors via direct interactions in uninstrumented environments can lead to generalist robots capable of enhancing productivity or providing care in unstructured settings like homes. Such uninstrumented settings warrant operations only using the robot's proprioceptive sensor such as onboard cameras, joint encoders, etc which can be challenging for policy learning owing to the high dimensionality and partial observability issues. We propose RRL: Resnet as representation for Reinforcement Learning -- a straightforward yet effective approach that can learn complex behaviors directly from proprioceptive inputs. RRL fuses features extracted from pre-trained Resnet into the standard reinforcement learning pipeline and delivers results comparable to learning directly from the state. In a simulated dexterous manipulation benchmark, where the state of the art methods fail to make significant progress, RRL delivers contact rich behaviors. The appeal of RRL lies in its simplicity in bringing together progress from the fields of Representation Learning, Imitation Learning, and Reinforcement Learning. Its effectiveness in learning behaviors directly from visual inputs with performance and sample efficiency matching learning directly from the state, even in complex high dimensional domains, is far from obvious.

研究の動機と目的

  • カメラやジョイントエンコーダーなどの本体センサのみを用いて、非構造的かつ現実世界の環境で複雑な行動を学習する課題に対処すること。
  • 高次元的かつ部分的に観測可能な視覚入力が、現実世界のロボティクスにおけるサンプル効率的強化学習を困難にしている問題を克服すること。
  • タスク固有または環境計器化された状態表現に依存するのを減らし、汎用的で事前学習済みの視覚的特徴量を活用すること。
  • 固定された事前学習済みResNet特徴量が、複雑で高次元の制御タスクにおいて状態ベースの強化学習と同等の性能を達成できることを示すこと。

提案手法

  • ImageNetで事前学習済みのResNet-34モデルを、生のRGB観測から特徴量を抽出する固定された視覚エンコーダーとして使用する。
  • 微調整や共同最適化を一切行わず、固定されたResNet特徴量を標準のオンポリシー強化学習アルゴリズム(例:DAPG)に直接統合する。
  • ImageNetに含まれる多様な現実世界の画像の分布を活用することで、ポリシー学習中に遭遇する多様な現実世界の視覚的分布に一般化する表現を確保する。
  • ポリシーと表現の共同最適化による非定常性を回避することで、安定した学習プロセスを維持する。
  • 再訓練を必要とせず、複数のタスクに同一の事前学習済みエンコーダーを適用し、類似した視覚的特徴を持つ新しいタスクへのゼロショット転移を可能にする。
  • 状態情報の使用を避け、タスク固有のデータオーグメンテーションや表現の事前学習も行わない。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みResNet特徴量は、現実世界のロボティクス制御におけるエンドツーエンド強化学習のための効果的で汎用的な視覚的表現として機能するか?
  • RQ2固定された事前学習済みエンコーダーを用いることで、表現とポリシーの共同学習に比べて、サンプル効率性と学習安定性が向上するか?
  • RQ3状態の最先端手法が顕著な進展を示さない接触が豊富な複雑な操作タスクにおいて、RRLの性能はいかがなっているか?
  • RQ4ImageNetから学習された表現は、多様な視覚的分布を持つタスク間でどれほど一般化できるか?特にタスク固有の表現と比較して。
  • RQ51つの固定された表現が、追加の事前学習なしに、多様で高次元のロボティクス制御タスク間で効果的な転移を可能にするか?

主な発見

  • Adroit Manipulationベンチマーク(複雑で接触が豊富な高度な操作タスクのスイート)において、RRLは完全な状態情報を利用した最先端手法と同等の性能を達成した。
  • DMControlベンチマークでは、100Kおよび500K環境ステップにおいて、RAD や SAC+AE といったタスク固有の手法に比べてRRLは性能が劣っている。これは、単純で低複雑性の環境ではタスク固有の表現がよりサンプル効率的であることを示している。
  • タスク固有の表現(例:CartPoleで事前学習されたRADエンコーダー)は、他のDMControl環境では著しく性能が低下し、タスク間での一般化性が低いことが示された。
  • 固定された事前学習済みResNet-34エンコーダーを用いることで、RRLはより安定した学習が可能となり、表現とポリシーの共同学習で一般的に見られる非定常性の問題を回避した。
  • 図5に示すように、表現ヘッドを再学習から省くことで、大幅なサンプルおよび計算リソースの節約が達成された。
  • 結果から、シミュレーションベンチマーク(例:DMControl)と現実世界のロボティクスタスクとの間には大きなドメインギャップがあることが明らかになった。今後の強化学習研究において、より現実的なベンチマークの必要性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。