Skip to main content
QUICK REVIEW

[論文レビュー] SCONE: Surface Coverage Optimization in Unknown Environments by Volumetric Integration

Antoine Guédon, Pascal Monasse|arXiv (Cornell University)|Aug 22, 2022
Advanced Vision and Imaging被引用数 4
ひとこと要約

SCONEは、可視性スコアのモンテカルロ統合とボリュメトリックな占有予測を組み合わせることで、大規模で未知の3次元環境における次なる最良の視点(NBV)予測のためのディープラーニング手法を提案する。自己注意機構を用いたニューラルネットワークにより占有確率と可視性を予測し、自由な6次元カメラ運動を伴う正確な表面カバレッジ最適化を実現し、オブジェクトレベルおよび大規模なシーン再構築タスクの両方で先行手法を上回る性能を発揮する。

ABSTRACT

Next Best View computation (NBV) is a long-standing problem in robotics, and consists in identifying the next most informative sensor position(s) for reconstructing a 3D object or scene efficiently and accurately. Like most current methods, we consider NBV prediction from a depth sensor like Lidar systems. Learning-based methods relying on a volumetric representation of the scene are suitable for path planning, but have lower accuracy than methods using a surface-based representation. However, the latter do not scale well with the size of the scene and constrain the camera to a small number of poses. To obtain the advantages of both representations, we show that we can maximize surface metrics by Monte Carlo integration over a volumetric representation. In particular, we propose an approach, SCONE, that relies on two neural modules: The first module predicts occupancy probability in the entire volume of the scene. Given any new camera pose, the second module samples points in the scene based on their occupancy probability and leverages a self-attention mechanism to predict the visibility of the samples. Finally, we integrate the visibility to evaluate the gain in surface coverage for the new camera pose. NBV is selected as the pose that maximizes the gain in total surface coverage. Our method scales to large scenes and handles free camera motion: It takes as input an arbitrarily large point cloud gathered by a depth sensor as well as camera poses to predict NBV. We demonstrate our approach on a novel dataset made of large and complex 3D scenes.

研究の動機と目的

  • 大規模で複雑な3次元シーンにおいて、スケーラビリティに欠ける(表面ベースの)か、正確性に欠ける(ボリュメトリックな)既存のNBV手法の限界を解消すること。
  • 球体の周囲に制限されない自由な6次元カメラ運動を許容する未知の環境において、効果的なパスプランニングと3次元再構築を可能にすること。
  • ボリュメトリック表現のスケーラビリティと表面ベースの指標の正確性を、ボリューム占有フィールド上のモンテカルロ統合を用いて統合すること。
  • 深 implicitly 関数と自己注意を用いて、任意のカメラポーズにおける表面カバレッジの増加を予測する学習可能で微分可能なフレームワークを開発すること。
  • 自由なカメラ運動を伴うNBV手法のベンチマーク化を目的として、CCライセンス下での新しい大規模・複雑な3次元シーンデータセットを構築すること。

提案手法

  • 入力点群から3次元シーンボリューム内の占有確率を予測する深層暗黙ネットワークを用い、高解像度かつスケーラブルな幾何推定を実現する。
  • 2番目のニューラルモジュールが、占有確率とカメラ履歴に基づいて、全方向のサンプル3次元点の可視性の可能性を自己注意を用いて予測する。
  • 任意の候補カメラポーズにおける表面カバレッジ増加を推定するために、ボリューム占有フィールド上でモンテカルロ統合を適用する。
  • NBVは、合計可視表面積の増加を最大化するポーズとして選択される。
  • 大規模なシーンへのスケーラビリティを高めるために、グローバル埋め込みではなく局所点群のグリッドを用いる。
  • 占有および可視性予測モジュールの学習に、連続的IoU指標とKullback-Leibler発散損失を用いる。

実験結果

リサーチクエスチョン

  • RQ1ボリュームベースのディープラーニングアプローチは、大規模な3次元シーンにおいても表面カバレッジ推定の高精度を達成できるか?
  • RQ2ボリューム占有フィールド上のモンテカルロ統合は、NBV選択のための表面カバレッジ増加を効果的に最適化できるか?
  • RQ3カメラ履歴を組み込むことで、自由な6次元運動シナリオにおけるNBV選択性能が向上するか?
  • RQ4単一オブジェクトデータセットで学習したモデルは、自由なカメラ運動を伴う複雑な大規模3次元シーンに一般化可能か?
  • RQ5表面カバレッジおよび再構築品質の観点から、提案手法は最先端のNBV手法を上回るか?

主な発見

  • SCONEはShapeNetデータセットにおいてSOTAを上回り、テストセットで平均表面カバレッジ0.625を達成し、先行の学習ベース手法を上回った。
  • エッフェル塔や伏見城といった大規模シーンでは、それぞれ平均表面カバレッジ0.741および0.802を達成し、優れた一般化性能を示した。
  • アブレーションスタディの結果、近隣特徴は占有予測において極めて重要であり、導入することでMSEが0.0816から0.0397に低下した。
  • 占有および可視性モジュールを備えた完全なモデルは、ベースラインと比較してKullback-Leibler発散損失を30%削減し、カバレッジ増加の分布推定がより良好であることを示した。
  • カメラ履歴特徴は、特に最大の増加を特定する際にわずかにNBV選択精度を向上させたが、全体のカバレッジ分布に顕著な影響を与えるものではなかった。
  • 訓練ドメインを越えた複雑なシーンに対しても、本手法は良好な一般化性能を示した。これは、CCライセンス下の新しい大規模3次元シーンデータセットを用いた検証で裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。