Skip to main content
QUICK REVIEW

[論文レビュー] Denoised MDPs: Learning World Models Better Than the World Itself

Tongzhou Wang, Simon S. Du|arXiv (Cornell University)|Jun 30, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、観測から制御不能かつ報酬に関係のないノイズを明示的に要因分解することで、より効率的で頑健な強化学習を可能にする、Denoised MDPsという手法を提案する。信号(制御可能で報酬関連)とノイズに分離することで、多様な制御および非制御タスクにおいて優れた性能を発揮し、ノイズの多い環境や生の画像観測においても先行手法を上回る。

ABSTRACT

The ability to separate signal from noise, and reason with clean abstractions, is critical to intelligence. With this ability, humans can efficiently perform real world tasks without considering all possible nuisance factors.How can artificial agents do the same? What kind of information can agents safely discard as noises? In this work, we categorize information out in the wild into four types based on controllability and relation with reward, and formulate useful information as that which is both controllable and reward-relevant. This framework clarifies the kinds information removed by various prior work on representation learning in reinforcement learning (RL), and leads to our proposed approach of learning a Denoised MDP that explicitly factors out certain noise distractors. Extensive experiments on variants of DeepMind Control Suite and RoboDesk demonstrate superior performance of our denoised world model over using raw observations alone, and over prior works, across policy optimization control tasks as well as the non-control task of joint position regression.

研究の動機と目的

  • 現実の強化学習環境における信号とノイズの区別を形式化すること。
  • 制御不能または報酬に関係のないノイズの干渉要因を特定・除去し、世界モデルの品質を向上させること。
  • このようなノイズを自動で要因分解する学習可能なフレームワークを開発し、より効率的で頑健な方策最適化を実現すること。
  • Denoised MDPsが制御タスクにとどまらず、非制御の回帰タスクに対しても一般化できることを示すこと。

提案手法

  • 制御可能性と報酬関連性に基づき、環境情報の種別を4つに分類する:制御可能/報酬関連、制御可能/関連なし、制御不能/報酬関連、制御不能/関連なし。
  • Denoised MDPsを、制御可能で報酬関連の成分のみをコア状態表現として明示的にモデル化するフレームワークとして提案する。
  • 変分オートエンコーダーを用いたアーキテクチャにより、観測を信号とノイズに分離し、ノイズが報酬に依存しないように制約を課す。
  • 信号空間が将来の状態と報酬を予測可能であるよう、対照学習の目的関数を適用する。
  • 信号が制御可能で、ノイズが制御不能かつ報酬に関係のないことを強制する誘導的バイアスを導入する。
  • 再構成、対照学習、報酬予測の目的関数を組み合わせて、エンドツーエンドで世界モデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1制御可能性と報酬関連性に基づいて、環境情報の系統的分類を信号とノイズに可能か?
  • RQ2制御不能かつ報酬に関係のないノイズを明示的に除去する学習済世界モデルは、生の観測に基づいて訓練されたモデルを上回る性能を発揮できるか?
  • RQ3ノイズ除去は制御タスクにとどまらず、非制御の教師あり回帰タスクに対しても性能向上をもたらすか?
  • RQ4提案されたフレームワーク下で、TIA や CURL といった既存手法は、多様なノイズタイプに対してどのように比較されるか?

主な発見

  • Denoised MDPsは、DeepMind Control Suiteの4種類のノイズ変種(センサーノイズ、カメラジターリング、動画背景、ノイズのあるセンサー)において、TIA や CURL および他のベースラインを常に上回る性能を発揮した。
  • 本手法は、制御タスクおよび関節位置の同時回帰タスクの両方で最先端の性能を達成し、強化学習にとどまらない一般化を示した。
  • Reacher Easy with Video Background の設定では、Denoised MDPsは TIA より25%高い平均報酬、CURL より15%高い平均報酬を達成した。
  • 可視化結果から、Denoised MDPsは正しくエージェントの運動を信号として分離し、背景の変化をノイズとしてモデル化しているのに対し、TIA はそれらを分離できていないことが確認された。
  • Denoised MDPsを用いて訓練されたモデルベースエージェントは、モデルフリーのベースラインに比べて優れたサンプル効率と頑健性を示した。
  • ノイズ除去された世界モデルは、正確な関節位置回帰を可能にし、クリーンな表現が標準的な強化学習の目的関数を超えて有益であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。