Skip to main content
QUICK REVIEW

[論文レビュー] Environment Predictive Coding for Embodied Agents

Santhosh Kumar Ramakrishnan, Tushar Nagarajan|arXiv (Cornell University)|Feb 3, 2021
Human Pose and Action Recognition参考文献 62被引用数 5
ひとこと要約

本論文は、エゴセントリック動画シーケンスにおけるマスク処理された視覚的コンテンツをカメラポーズを条件として予測するように訓練するエージェントを用いて、3次元環境レベルの表現を自己教師付きで学習する、環境予測符号化(EPC)を提案する。EPCは、GibsonおよびMatterport3Dのナビゲーションタスクにおいて、限定的な経験量でのみ、優れたサンプル効率性と頑性を達成し、最先端の手法を上回る性能を示す。

ABSTRACT

We introduce environment predictive coding, a self-supervised approach to learn environment-level representations for embodied agents. In contrast to prior work on self-supervised learning for images, we aim to jointly encode a series of images gathered by an agent as it moves about in 3D environments. We learn these representations via a zone prediction task, where we intelligently mask out portions of an agent's trajectory and predict them from the unmasked portions, conditioned on the agent's camera poses. By learning such representations on a collection of videos, we demonstrate successful transfer to multiple downstream navigation-oriented tasks. Our experiments on the photorealistic 3D environments of Gibson and Matterport3D show that our method outperforms the state-of-the-art on challenging tasks with only a limited budget of experience.

研究の動機と目的

  • エゴセントリックな視覚ナビゲーションにおける汎用的で高レベルの3次元環境表現の欠如に取り組む。
  • 非構造的なエゴセントリック動画データから環境レベルの表現を学習することで、ナビゲーションタスクにおけるサンプル効率性と転移性を向上させる。
  • 動画ウォークスルーから学習した幾何学的および意味的事前知識を用いて、未確認の3次元環境部分についての推論を可能にする。
  • タスク固有の監視情報や手作業で作成された地図に依存しない自己教師付き手法を開発する。

提案手法

  • エゴセントリック動画シーケンスを、視覚的および幾何学的に接続されたゾーンに分割し、重複は限定的とする。
  • トラジェクトリーデータからランダムにゾーンをマスクし、変換器ベースのモデルを用いて、マスクされていない視覚情報とカメラポーズを用いてマスクされたビューを予測するように訓練する。
  • 予測が視覚特徴と3次元カメラポーズ情報の両方に条件付けられるため、モデルはゾーン予測タスクを解くことで環境レベルの表現を学習する。
  • 自己教師付き事前学習は、Gibson や Matterport3D などの3次元環境からの大規模なウォークスルービデオで実施される。
  • 得られた環境埋め込み表現は、エリアカバレッジ、オブジェクトナビゲーション、ポイントベースナビゲーションなどの下流タスクに微調整または転移可能である。
  • 本手法は、標準的な動画予測やコンテキスト予測タスクとは異なり、予測を3次元空間的関係に明示的に根拠づけている。

実験結果

リサーチクエスチョン

  • RQ1自己教師付きで環境レベルの表現を学習することで、エムベデッドエージェントナビゲーションにおけるサンプル効率性が向上するか?
  • RQ2ウォークスルー動画で学習したモデルが、ポーズ情報とマスクされていないビューのみを用いて、3次元環境の欠落した視覚的コンテンツを推定できるか?
  • RQ3EPCは、画像レベルの表現学習やエンドツーエンド学習と比較して、下流タスクのパフォーマンスと頑性において優れているか?
  • RQ4EPCはセンサーノイズや最適でない動画収集戦略に対してどの程度頑健であるか?

主な発見

  • Gibson-Sでは31.5 m²のエリアカバレッジを達成し、1300万フレームでSMT (Video)を2.8 m²上回る。Gibson-Lでは64.0 m²を達成し、SMT (Video)を19.3 m²上回る。
  • Matterport3Dでは176.3 m²のエリアカバレッジと13.8のオブジェクトカバレッジを達成し、SMT (Video)の126.2 m²および10.0オブジェクトカバレッジを大きく上回る。
  • 単純なヒューリスティクスによる動画収集や、深度およびポーズノイズを組み込んだ場合でも、EPCは高い性能を維持し、データ品質の変動に対して頑健であることを示している。
  • 深度センサーやポーズセンサーにノイズが加わった場合でも、EPCはすべてのベースライン(包括してOccupancyMemory)を上回り、センサーノイズに対して優れた頑健性を示している。
  • オフポリシーなウォークスルー動画による追加経験を考慮しても、EPCはその性能優位性を維持しており、真のサンプル効率性を示している。
  • MP3D-catでは9.0のオブジェクトカバレッジ、MP3D-instでは36.4を達成し、両指標において次に優れた手法を大きく上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。