Skip to main content
QUICK REVIEW

[論文レビュー] AutoNeRF: Training Implicit Scene Representations with Autonomous Agents

Pierre Marza, Laëtitia Matignon|arXiv (Cornell University)|Apr 21, 2023
Robot Manipulation and Learning被引用数 5
ひとこと要約

AutoNeRFは、人間の介入なしにNeural Radiance Fields(NeRF)の学習に必要なデータ収集を自律的に行う強化学習ベースのモジュラー・エージェントを提案する。本手法は、1回のエピソードでの探索のみで、3Dシーン再構築、計画、ポーズ最適化といった下流のロボットタスクにおいて最先端の性能を達成し、モジュラー方策がフロンティアベースおよびエンドツーエンドRLのベースラインを上回る。

ABSTRACT

Implicit representations such as Neural Radiance Fields (NeRF) have been shown to be very effective at novel view synthesis. However, these models typically require manual and careful human data collection for training. In this paper, we present AutoNeRF, a method to collect data required to train NeRFs using autonomous embodied agents. Our method allows an agent to explore an unseen environment efficiently and use the experience to build an implicit map representation autonomously. We compare the impact of different exploration strategies including handcrafted frontier-based exploration, end-to-end and modular approaches composed of trained high-level planners and classical low-level path followers. We train these models with different reward functions tailored to this problem and evaluate the quality of the learned representations on four different downstream tasks: classical viewpoint rendering, map reconstruction, planning, and pose refinement. Empirical results show that NeRFs can be trained on actively collected data using just a single episode of experience in an unseen environment, and can be used for several downstream robotic tasks, and that modular trained exploration models outperform other classical and end-to-end baselines. Finally, we show that AutoNeRF can reconstruct large-scale scenes, and is thus a useful tool to perform scene-specific adaptation as the produced 3D environment models can be loaded into a simulator to fine-tune a policy of interest.

研究の動機と目的

  • 未確認の3D環境において、体験的エージェントを用いてNeRFの学習に適した自律的データ収集を可能にすること。
  • レンダリング品質に加え、計画、マップ再構築、ポーズ最適化といったロボット関連の下流タスクを含めたNeRFの評価を実施すること。
  • フロンティアベース、エンドツーエンドRL、モジュラーRLの異なる探索戦略が、NeRF学習品質に与える影響を比較すること。
  • 強化学習における報酬設計が、学習された暗黙的表現の下流タスクへの有用性に与える影響を調査すること。
  • 1回のエピソードによる自律的探索で、シミュレーション内でのポリシー微調整に使用可能な高品質なシーン固有の3Dモデルを生成できることを実証すること。

提案手法

  • 高レベルのプランナと低レベルのコントローラーから構成されるモジュラー強化学習方策を訓練し、3D環境を自律的に探索する。
  • カバレッジ、ノベルティ、再構築、障害物回避、ビューポイント多様性といった複数の報酬関数を用いて、探索を誘導し、NeRF学習データの品質を最適化する。
  • エージェントが収集したデータに基づいて訓練されたNeRFモデルを用い、RGB観測から連続的かつ微分可能な3Dシーン表現を生成する。
  • Fast Marching法と幾何的推論を用いて、NeRFからビーバードアイビュー(BEV)マップおよびセマンティックマップを生成し、下流の計画およびマッピングタスクに活用する。
  • レンダリングされたNeRF出力を用いて視覚伺服制御およびポーズ最適化技術を適用し、カメラの視点を最適化する。
  • RGB観測からセマンティックマスクを推定するためにMask R-CNNを用い、真値アノテーションが不要なエンドツーエンドのセマンティックNeRF学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、未確認の環境において1回のエピソードの探索で、NeRFの学習に十分なデータを自律的に収集できるか?
  • RQ2フロンティアベース、エンドツーエンドRL、モジュラーRLの異なる探索戦略は、複数のロボットタスクにおける下流のNeRF品質においてどのように比較されるか?
  • RQ33D再構築、計画、レンダリングといったNeRFベースのタスクにおいて、探索時のどの報酬関数が最も優れた性能をもたらすか?
  • RQ4自律的収集データから学習されたNeRFは、シミュレーション内でのシーン固有ポリシーの適応にどの程度寄与できるか?
  • RQ5Mask R-CNNからのノイズの多いセマンティック信号を用いた場合、真値シミュレーションラベルと比較して、NeRFベースのセマンティック表現の品質はどの程度低下するか?

主な発見

  • モジュラーRL方策は、すべての下流タスクにおいてフロンティアベース探索およびエンドツーエンドRLベースラインを上回り、PointGoalナビゲーションで39.5%の成功率、ObjectGoalナビゲーションで16.0%のSPLを達成した。
  • ビューポイント多様性を報酬とする「Ours (view.)」方策は、PointGoalタスクで39.0%の成功率および38.6%のSPLを達成し、全体として最高の性能を示した。
  • 1回のエピソードによる自律的探索で収集されたデータから学習されたNeRFは、高品質な3Dシーン再構築を可能にし、レンダリングタスクにおいてセマンティックmIoUが83.2%、クラス別精度が91.8%を達成した。
  • NeRFレンダリング出力を用いたポーズ最適化により、並進誤差が0.00734m、回転誤差が0.292°にまで低下し、ベースライン手法を上回った。
  • Mask R-CNNからのノイズの多いセマンティック信号でさえも、マップ比較で99.8%のセマンティック精度、ObjectGoal計画で15.8%の成功率を達成し、ドメインシフトに対して高いロバスト性を示した。
  • 本手法は大規模な住宅スケールのシーンを効果的に再構築でき、人的アノテーションなしにシミュレーション内でのシーン固有ポリシー微調整を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。