Skip to main content
QUICK REVIEW

[論文レビュー] Im2Pano3D: Extrapolating 360 Structure and Semantics Beyond the Field of View

Shuran Song, Andy Zeng|arXiv (Cornell University)|Dec 12, 2017
Advanced Vision and Imaging参考文献 3被引用数 11
ひとこと要約

Im2Pano3Dは、部分的なRGB-D観測(≤50%視野)から360° 3Dシーン構造およびセマンティックラベルを外挿するためのディープラーニングフレームワークを提案する。平面方程式符号化と合成および実世界の屋内データを用いたマルチスーパービジョンを採用し、56%のピクセル精度と0.52m未満の平均表面距離誤差を達成する完全パノラマシーンを予測する。これはベースラインを著しく上回る性能を示す。

ABSTRACT

We present Im2Pano3D, a convolutional neural network that generates a dense prediction of 3D structure and a probability distribution of semantic labels for a full 360 panoramic view of an indoor scene when given only a partial observation (<= 50%) in the form of an RGB-D image. To make this possible, Im2Pano3D leverages strong contextual priors learned from large-scale synthetic and real-world indoor scenes. To ease the prediction of 3D structure, we propose to parameterize 3D surfaces with their plane equations and train the model to predict these parameters directly. To provide meaningful training supervision, we use multiple loss functions that consider both pixel level accuracy and global context consistency. Experiments demon- strate that Im2Pano3D is able to predict the semantics and 3D structure of the unobserved scene with more than 56% pixel accuracy and less than 0.52m average distance error, which is significantly better than alternative approaches.

研究の動機と目的

  • カメラの視野外における屋内シーンの3D構造とセマンティクスを推定する課題に対処すること。
  • 制限された観測から完全なパノラマビューを外挿できる統合的なディープラーニングフレームワークの開発。
  • 一般化性能の向上を図るため、大規模な合成および実世界の屋内データセットからの強力な文脈的事前知識の活用。
  • 認識および再構築の両方のタスクを支援するロバストな3D表現の設計。

提案手法

  • Im2Pano3Dは畳み込みニューラルネットワークを用い、部分的なRGB-D入力から完全な360°パノラマビューの3D構造とセマンティック確率を予測する。
  • 生の深度ではなく、平面方程式(ax + by + cz + d = 0)を用いて3D表面を表現することで、区分的定数でロバストな予測が可能になる。
  • 強力な文脈的事前知識を学習するため、合成(SUNCG)および実世界(Matterport3D)の屋内シーンの組み合わせでモデルを訓練する。
  • ピクセル単位の再構築損失、 adversarial損失、およびシーン属性損失を用いたマルチレベルのスーパービジョンにより、局所的正確性とグローバル整合性の両方を確保する。
  • 一般化性能を向上させるために、トレーニング中にランダムな視野マスクを適用する。
  • RGB-D、カラーパノラマ、深度アノテーション付きパノラマを含む、複数の入力モodalをサポートする。

実験結果

リサーチクエスチョン

  • RQ1部分的観測に基づいて、屋内シーンの観測されていない領域の3D構造とセマンティクスを正確に予測できるか?
  • RQ2生の深度予測と比較して、平面方程式表現は3D構造予測のロバスト性をどの程度向上させるか?
  • RQ3SUNCGで事前学習することで、Matterport3Dのような実世界ベンチマークでの性能はどの程度向上するか?
  • RQ4観測領域からの距離や入力視野が予測精度にどのように影響するか?
  • RQ5多様なカメラ設定や入力モダリティにわたって、モデルは一般化できるか?

主な発見

  • Im2Pano3Dは、観測されていない領域の3D構造とセマンティクス予測において56%のピクセル精度を達成し、他の手法を著しく上回る。
  • 平均表面距離誤差は0.52m未満であり、外挿された3D構造の高い幾何的正確性を示している。
  • SUNCGで事前学習することで、Matterport3DにおけるPoGで9%、表面距離で4%の性能向上が見られ、合成データの価値が顕著に示された。
  • 観測領域からの距離が増すにつれて性能は低下するが、特に遮蔽領域や遠方領域においてもベースラインを著しく上回る。
  • 単一/複数のRGB-D、パノラマカラーデータ、深度パノラマの組み合わせなど、多様なカメラ設定や入力モダリティにわたって効果的に一般化できる。
  • SUNCGでのみ学習したモデルが、Matterport3DでのセグメンテーションタスクでMatterport3D専用で学習したモデルを上回る結果を示しており、合成データからのゼロショット一般化の強さが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。