Skip to main content
QUICK REVIEW

[論文レビュー] Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI

Santhosh Kumar Ramakrishnan, Aaron Gokaslan|arXiv (Cornell University)|Sep 16, 2021
Robotics and Sensor-Based Localization被引用数 81
ひとこと要約

HM3D は 1000 の建物規模の再構成を含む大規模で高忠実度の 3D 室内データセットであり、 prior datasets より規模・完全性・視覚的忠実度が高く、複数のテスト環境での embodiment AI ナビゲーションを向上させる。

ABSTRACT

We present the Habitat-Matterport 3D (HM3D) dataset. HM3D is a large-scale dataset of 1,000 building-scale 3D reconstructions from a diverse set of real-world locations. Each scene in the dataset consists of a textured 3D mesh reconstruction of interiors such as multi-floor residences, stores, and other private indoor spaces. HM3D surpasses existing datasets available for academic research in terms of physical scale, completeness of the reconstruction, and visual fidelity. HM3D contains 112.5k m^2 of navigable space, which is 1.4 - 3.7x larger than other building-scale datasets such as MP3D and Gibson. When compared to existing photorealistic 3D datasets such as Replica, MP3D, Gibson, and ScanNet, images rendered from HM3D have 20 - 85% higher visual fidelity w.r.t. counterpart images captured with real cameras, and HM3D meshes have 34 - 91% fewer artifacts due to incomplete surface reconstruction. The increased scale, fidelity, and diversity of HM3D directly impacts the performance of embodied AI agents trained using it. In fact, we find that HM3D is `pareto optimal' in the following sense -- agents trained to perform PointGoal navigation on HM3D achieve the highest performance regardless of whether they are evaluated on HM3D, Gibson, or MP3D. No similar claim can be made about training on other datasets. HM3D-trained PointNav agents achieve 100% performance on Gibson-test dataset, suggesting that it might be time to retire that episode dataset.

研究の動機と目的

  • 現実世界の室内建物の、大規模でほぼ完全な 3D 再構成データセットを提供する。
  • 既存データセットと比較して視覚的忠実度を向上させ、再構成アーティファクトを低減する。
  • ナビゲーション課題におけるエンボディドAIエージェントの訓練と評価に対する HM3D の有用性を示す。
  • 複数のテスト環境における HM3D 訓練エージェントのパレート最適転送性能を示す。

提案手法

  • Matterport Pro2 スキャンと Matterport パイプラインを用いて、1000 の建物規模の室内を撮影・再構成する。
  • 定量的指標を用いて、既存データセットと比較した規模・完全性・視覚忠実度を定量化する。
  • HM3D を訓練データとした場合のエンボディドAI ナビゲーション(PointGoal/PointNav)性能を、他のデータセットと比較して評価する。
  • Habitat シミュレータでの訓練を促進するため、Habitat-ready のメタデータと統合を提供する。

実験結果

リサーチクエスチョン

  • RQ1既存の室内データセットと比較して、HM3D はエンボディドAIエージェントの訓練に対してスケーラブルな利点を提供するか?
  • RQ2HM3D の規模・完全性・忠実度は、エージェントのナビゲーション性能とデータセット間の一般化にどのような影響を与えるか?
  • RQ3Gibson、MP3D、HM3D のテストセット全体での性能の観点から、HM3D での訓練はパレート最適か?
  • RQ4HM3D の視覚忠実度と再構成の完全性は、実世界の画像や既存データセットとどう比較されるか?
  • RQ5訓練シーンのナビゲーション可能エリアを増やすことは、PointNav の性能向上と相関するか?

主な発見

  • HM3D は 1000 の建物規模の再構成と 112.5k m^2 の navigable space を提供し、規模の点で MP3D および Gibson を上回る。
  • HM3D は prior photorealistic データセットと比較して再構成アーティファクトが 34.91% 少なく、視覚忠実度が 20.85% 向上している。
  • HM3D で訓練した PointNav エージェントは Gibson、MP3D、および HM3D のテストセット全体で最新またはパレート最適な性能を達成し、深度入力を用いた Gibson テストで 100% 成功を含む。
  • レンダリングされた HM3D 画像は MP3D および Gibson の実画像ベースラインと比較して FID/KID スコアが大幅に低く、実画像への視覚忠実度が高いことを示している。
  • 訓練 HM3D シーンの総可 navigable エリアに対してナビゲーション性能はほぼ直線的にスケールする(rho ≈ 0.88)。
  • HM3D エージェントはより難しいエピソードへもより良く一般化し、多様なレイアウトと外観が転移性を助けることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。