Skip to main content
QUICK REVIEW

[論文レビュー] Generalization in Reinforcement Learning by Soft Data Augmentation

Nicklas Hansen, Xiaolong Wang|arXiv (Cornell University)|Nov 26, 2020
Reinforcement Learning in Robotics参考文献 43被引用数 16
ひとこと要約

本稿では、視覚ベース強化学習における表現学習と方策最適化を分離することで、サンプル効率性、一般化性能、訓練安定性を向上させるソフトデータオーグメンテーション手法SODAを提案する。SODAは、拡張済み観測と元の観測間の相互情報量を最大化する共有エンコーダを訓練すると同時に、非拡張データ上で方策を訓練することで、10のDMControl-GBタスクのうち9つで最先端性能を達成し、すべてのロボット操作テスト環境でも優れた性能を示した。

ABSTRACT

Extensive efforts have been made to improve the generalization ability of Reinforcement Learning (RL) methods via domain randomization and data augmentation. However, as more factors of variation are introduced during training, optimization becomes increasingly challenging, and empirically may result in lower sample efficiency and unstable training. Instead of learning policies directly from augmented data, we propose SOft Data Augmentation (SODA), a method that decouples augmentation from policy learning. Specifically, SODA imposes a soft constraint on the encoder that aims to maximize the mutual information between latent representations of augmented and non-augmented data, while the RL optimization process uses strictly non-augmented data. Empirical evaluations are performed on diverse tasks from DeepMind Control suite as well as a robotic manipulation task, and we find SODA to significantly advance sample efficiency, generalization, and stability in training over state-of-the-art vision-based RL methods.

研究の動機と目的

  • 視覚ベース強化学習において、直接的に拡張データ上で方策を訓練することで生じる不安定性とサンプル効率性の低下を解消すること。
  • 訓練の安定性を損なわずに、視覚的に多様で未観測の環境への一般化を向上させること。
  • 強力なデータオーグメンテーションを表現学習に活用しつつ、強化学習最適化への干渉を最小限に抑える手法を開発すること。
  • 視覚ベース強化学習における一般化評価のための新たなベンチマークを確立すること。
  • 拡張処理と方策学習の分離が、最先端手法を上回る性能をもたらすことを実証すること。

提案手法

  • SODAは、拡張済み観測と非拡張観測の両方を同じ潜在空間にマップする共有エンコーダを用いる。
  • 潜在表現同士の相互情報量の最大化を通じて、拡張済みおよび元の観測の潜在表現間にソフト制約を課す。
  • 方策学習は非拡張データに限定して実施され、最適化の安定性が保たれる。
  • 非拡張観測のためのモーメンタム更新付きターゲットネットワークを採用し、表現学習の安定化を図る。
  • データオーグメンテーションは、補助的表現学習タスク中にのみ適用され、方策学習時には適用されない。
  • 本手法は自己教師ありであり、対照的学習手法(例:CURL)とは異なり、ネガティブサンプルを必要としない。

実験結果

リサーチクエスチョン

  • RQ1データオーグメンテーションを用いる際、方策学習を直接行うことで生じる不安定性を解消しつつ、視覚ベース強化学習における一般化性能を向上させることは可能か?
  • RQ2データオーグメンテーションと方策学習を分離することで、より優れたサンプル効率性と安定性が得られるか?
  • RQ3拡張済み観測と元の観測間の相互情報量最大化が、表現の不変性を向上させられるか?
  • RQ4SODAは、多様で視覚的に挑戦的なテスト環境において、最先端手法と比較してどの程度の性能を示すか?
  • RQ5ランダムなカメラ、照明、テクスチャを想定した実世界の展開条件において、SODAは効果的に一般化できるか?

主な発見

  • SODAは、DMControl一般化ベンチマークの10の環境のうち9つで最先端手法を上回り、特にビデオ背景テスト条件下でのball_in_cup_catchタスクで最大81%の向上を達成した。
  • ロボット操作タスクでは、訓練環境で平均報酬21.3、ランダムカラーテスト環境で18.0を達成し、ベースラインを著しく上回った。
  • SODAは訓練のばらつきを低減し、サンプル効率性を向上させた。DMControlおよびロボット操作タスクの両方で、滑らかな訓練および一般化曲線が得られた。
  • ランダムカラーやビデオ背景環境に対しても、SODAは良好な一般化性能を示した。特に、訓練時とテスト時のオーグメンテーションタイプ(例:オーバーレイ対畳み込み)が異なる場合でも同様に有効であった。
  • オーバーレイオーグメンテーションを用いたSODAは、ランダム畳み込みを用いた場合よりも優れた一般化性能を示し、より豊かなオーグメンテーションが不変性学習を向上させることを示唆した。
  • SODAは、ロボット操作タスクのすべてのテスト分布(ランダムカメラ、照明、テクスチャを含む)で優れた性能を示し、実世界への展開可能性が非常に高いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。