Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Neural Radiance Fields

Danny Driess, Ingmar Schubert|arXiv (Cornell University)|Jun 3, 2022
Adversarial Robustness in Machine Learning被引用数 15
ひとこと要約

この論文では、強化学習(RL)のための潜在状態表現を学習するために、Neural Radiance Fields(NeRFs)を自己教師信号として用いるNeRF-RLという手法を提案している。マルチビューRGB画像を潜在空間にマッピングするエンコーダーを学習させ、潜在条件付きNeRFを介してシーンを再構築できるようにすることで、NeRFが持つ強力な3次元のインダクティブバイアスのおかげで、ロボット操作タスクにおける優れたサンプル効率を達成している。2次元CNNや対照的学習、さらには専門家が提供するキーポイントよりも優れた性能を発揮している。

ABSTRACT

It is a long-standing problem to find effective representations for training reinforcement learning (RL) agents. This paper demonstrates that learning state representations with supervision from Neural Radiance Fields (NeRFs) can improve the performance of RL compared to other learned representations or even low-dimensional, hand-engineered state information. Specifically, we propose to train an encoder that maps multiple image observations to a latent space describing the objects in the scene. The decoder built from a latent-conditioned NeRF serves as the supervision signal to learn the latent space. An RL algorithm then operates on the learned latent space as its state representation. We call this NeRF-RL. Our experiments indicate that NeRF as supervision leads to a latent space better suited for the downstream RL tasks involving robotic object manipulations like hanging mugs on hooks, pushing objects, or opening doors. Video: https://dannydriess.github.io/nerf-rl

研究の動機と目的

  • 高次元の画像観測からより良い状態表現を学習することで、視覚ベース強化学習におけるサンプル効率を向上させること。
  • Neural Radiance Fields(NeRFs)が持つ3次元のインダクティブバイアスが、2次元CNNや対照的学習よりも効果的な潜在表現を生み出せるかどうかを調査すること。
  • 手動で設計された状態情報に依存せずに、多様な物体形状にわたる一般化を可能にすること。
  • 複雑な3次元操作環境において、NeRFベースの監視が、学習された状態表現や専門家が提供する状態表現を上回ることを実証すること。

提案手法

  • エンコーダーがマルチビューRGB画像を潜在ベクトルにマッピングし、デコーダーが潜在条件付きNeRFであるオートエンコーダーを学習する。このNeRFデコーダーは、新しい視点からシーンを再構築できる。
  • 自己教師信号としてマルチビュー画像再構築損失を用い、エンコーダーとデコーダーを同時に学習する。NeRFデコーダーが強力な3次元のインダクティブバイアスを提供する。
  • グローバルなNeRFデコーダーとコンポジショナルなNeRFデコーダーを実装する:前者はシーン全体をエンコードし、後者はインスタンスセグメンテーションマスクを用いて個々の物体をエンコードする。
  • ランダムな行動のデータセット上で事前学習し、その後RLループ内で固定されたエンコーダーを用いてポリシーをファインチューニングする。
  • カメラ行列と複数の視点を活用して3次元シーン理解を向上させ、隠蔽を解消する。
  • 事前学習段階でNeRF再構築損失を適用し、潜在空間がタスクに必要な幾何的・空間的構造を捉えるように誘導する。

実験結果

リサーチクエスチョン

  • RQ1NeRFベースの自己教師信号は、2次元CNNや対照的学習よりも、視覚ベース強化学習におけるより効果的な状態表現を生み出せるか?
  • RQ2NeRFの3次元インダクティブバイアスは、変動する物体形状を含むロボット操作タスクにおけるサンプル効率と一般化性能を向上させるか?
  • RQ3専門家が提供するキーポイント監視と比較して、NeRF-RLの下流RL性能はどの程度か?
  • RQ4個々の物体をモデル化するコンポジショナルなNeRFデコーダーは、グローバルなNeRFデコーダーと比較して性能を向上させるか?
  • RQ5複数のカメラ視点の使用は、学習された潜在表現の質を向上させるか?

主な発見

  • NeRF-RLは、2次元CNNベースのオートエンコーダーや対照的学習のベースラインと比較して、サンプル効率および最終的な性能で顕著に優れていた。
  • コンポジショナルなNeRF-RLバージョンが最も高いサンプル効率を達成しており、NeRFを用いて個々の物体をモデル化する方が、シーン全体のモデル化よりも効果的であることが示された。
  • NeRF-RLは、専門家が提供するキーポイント監視を上回る性能を発揮し、NeRFデコーダーに内在する3次元のインダクティブバイアスの優位性を実証した。
  • 同じ分布内での異なる初期状態や物体形状に対しても、良好な一般化が達成されており、ロバストネスと一般化能力が裏付けられた。
  • インスタンスレベルの監視が不要なグローバルNeRF-RLバージョンでさえ、すべてのベースラインを上回った。これは、3次元のインダクティブバイアスが、インスタンスマスクなしでも有効であることを示している。
  • 事前学習コストが高め(最大2日間)であったが、推論時間は非常に短く(RTX 3090で約7 ms)、オンラインRLの実装に実用的であることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。