Skip to main content
QUICK REVIEW

[論文レビュー] In-Place Scene Labelling and Understanding with Implicit Scene Representation

Shuaifeng Zhi, Tristan Laidlow|arXiv (Cornell University)|Mar 29, 2021
Advanced Vision and Imaging参考文献 31被引用数 12
ひとこと要約

本論文では、3次元幾何、放射度、および意味的意味を、スパarsなもしくはノイズの多い現地アノテーションのみを用いて共同で符号化する、シーン固有のニューラルインクリメント表現であるSemantic-NeRFを提案する。NeRFのマルチビュー一貫性および滑らかさを活用することで、最小限の監督のもとで高品質な2次元意味的ラベリング、ラベルのノイズ除去、スーパーレゾリューション、マルチビュー統合を実現し、わずか10%のラベル付き画素で88.4%のmIoUを達成した。

ABSTRACT

Semantic labelling is highly correlated with geometry and radiance reconstruction, as scene entities with similar shape and appearance are more likely to come from similar classes. Recent implicit neural reconstruction techniques are appealing as they do not require prior training data, but the same fully self-supervised approach is not possible for semantics because labels are human-defined properties. We extend neural radiance fields (NeRF) to jointly encode semantics with appearance and geometry, so that complete and accurate 2D semantic labels can be achieved using a small amount of in-place annotations specific to the scene. The intrinsic multi-view consistency and smoothness of NeRF benefit semantics by enabling sparse labels to efficiently propagate. We show the benefit of this approach when labels are either sparse or very noisy in room-scale scenes. We demonstrate its advantageous properties in various interesting applications such as an efficient scene labelling tool, novel semantic view synthesis, label denoising, super-resolution, label interpolation and multi-view semantic label fusion in visual semantic mapping systems.

研究の動機と目的

  • 完全なアノテーションが不可能な新規の未確認環境において、正確な3次元意味的シーン理解を可能にすること。
  • NeRFの幾何的および光度的事前知識を活用して、スパarsまたはノイズの多い監視のもとで意味的ラベリングを向上させること。
  • 事前学習モデルや大規模データセットを必要とせず、シーン固有の自己教師付き手法として、幾何、外観、意味を同時に学習すること。
  • インタラクティブラベリング、ラベルのノイズ除去、スーパーレゾリューション、マルチビュー意味的統合といった実用的応用を示すこと。
  • インクリメントニューラル表現が、弱い監視のもとで視覚間を横断して意味的ラベルを効果的に伝搬できることを示すこと。

提案手法

  • 1つのインクリメント3次元表現内で幾何、放射度、意味的クラス確率を同時に予測する追加の意味的ヘッドをNeural Radiance Fields (NeRF)に拡張する。
  • 幾何的監視を一切用いずに、同じシーンからの姿勢付きRGB画像とスパarsまたはノイズの多い意味的ラベルを用いて、ネットワークをエンドツーエンドで学習する。
  • NeRFのインクリメント3次元表現に由来するマルチビュー一貫性および自己類似性を活用して、視覚間で効率的にラベルを伝搬する。
  • 視覚間の光度的一致性を介して、微分可能なレンダリングプロセスを用いて意味的予測を監視する。
  • NeRFのボリュームレンダリング損失と意味的交差エントロピー、一貫性正則化を組み合わせたマルチタスク損失を適用する。
  • 1つのインクリメントMLPを用いて、シーン全体を表現することで、高解像度かつ連続的な意味的ラベリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ11つのインクリメントニューラル表現が、幾何、外観、意味を共同でモデル化することで、最小限の監視のもとで正確な意味的ラベリングを可能にするか?
  • RQ2インクリメント3次元表現は、複数の視覚にわたってスパarsまたはノイズの多い意味的ラベルを効果的に伝搬できるか?
  • RQ3NeRFの幾何的および光度的事前知識は、オープンセットで現実世界のシーンにおいて意味的セグメンテーション性能をどの程度向上できるか?
  • RQ4真値深度を必要としない状況でも、統合表現が深度支援マルチビュー統合手法を上回るか?
  • RQ5ラベルの密度と品質は、提案フレームワークにおける意味的ラベル伝搬性能にどの程度影響を与えるか?

主な発見

  • 1クラスあたり1画素のラベルのみで、平均交差率(mIoU)が60.2%に達し、最小限の監視のもとで強力な一般化性能を示した。
  • ラベルの割合を10%に増加させると、mIoUは88.4%に向上し、わずかなラベリング作業で顕著な性能向上が得られた。
  • マルチビュー意味的統合において、68.0%のmIoUを達成し、真値深度を用いたベイジアンおよび平均統合ベースラインを上回った。
  • 滑らかで一貫性のあるインクリメント表現を用いることで、低品質または粗いラベルの精錬が効果的に実現された。
  • モデルは、多様なカメラポーズにおいても細部構造やオブジェクト境界を保持した正確な新規ビュー合成を可能にした。
  • フレームワークはインタラクティブラベリングをサポートしており、意味的曖昧性を解消するために最も情報量の多いラベルをモデルが特定・要求できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。