Skip to main content
QUICK REVIEW

[論文レビュー] FroDO: From Detections to 3D Objects

Kejie Li, Martin Rünz|arXiv (Cornell University)|May 11, 2020
Robotics and Sensor-Based Localization参考文献 5被引用数 13
ひとこと要約

FroDOは、2次元検出の刈り取り、ディリクレ過程に基づく線分クラスタリング、および共有されたDeepSDFと点群オートエンコーダを用いた高密度最適化を組み合わせることで、単一のRGB画像からの3次元オブジェクト再構築のための新規フレームワークを提案する。本手法は、Redwood-OSデータセットにおいて10.57 cmの平均チェンバーディスタンスを達成し、精度、速度、遮蔽に対する耐性の面で先行手法を著しく上回る。

ABSTRACT

Object-oriented maps are important for scene understanding since they jointly capture geometry and semantics, allow individual instantiation and meaningful reasoning about objects. We introduce FroDO, a method for accurate 3D reconstruction of object instances from RGB video that infers object location, pose and shape in a coarse-to-fine manner. Key to FroDO is to embed object shapes in a novel learnt space that allows seamless switching between sparse point cloud and dense DeepSDF decoding. Given an input sequence of localized RGB frames, FroDO first aggregates 2D detections to instantiate a category-aware 3D bounding box per object. A shape code is regressed using an encoder network before optimizing shape and pose further under the learnt shape priors using sparse and dense shape representations. The optimization uses multi-view geometric, photometric and silhouette losses. We evaluate on real-world datasets, including Pix3D, Redwood-OS, and ScanNet, for single-view, multi-view, and multi-object reconstruction.

研究の動機と目的

  • 限られた監視情報のもとで、単一のRGB画像からの正確な3次元オブジェクト形状の再構築という課題に対処すること。
  • 3次元最適化の前段階でノイズが多いまたは曖昧な2次元検出をフィルタリングすることで、再構築品質を向上させること。
  • スパースおよび高密度表現を共有された潜在的コード空間に統合することで、効率的かつ耐障害性の高い3次元形状最適化を可能にすること。
  • 適応的サンプリングとピラミッドベースの最適化により、計算コストを低減しながら高い精度を維持すること。
  • 手動でセグメンテーションされた3次元オブジェクト形状を追加することで、実世界のベンチマークを提供すること。

提案手法

  • 2次元検出の刈り取りは、バウンディングボックスのサイズ、オクルージョン(IoUを用いて)、他のオブジェクトとの重複という3つの基準を用い、低品質な検出を除外するためのしきい値を設定する。
  • ディリクレ過程(DP)-平均クラスタリングは、事前にクラスタ数を知らなくても、距離しきい値0.4を用いて3次元線分を検出結果からオブジェクトクラスタにグループ化する。
  • 点群とDeepSDF表現の両方に共通の64次元潜在的コード空間を用いることで、共同最適化と効率的な形状再構築を可能にする。
  • 合成的偏微分を、チェインルールとSDF勾配の擬似逆行列を用いて導出することで、最適化中の微分可能な表面座標更新を可能にする∂x/∂zを計算する。
  • 高密度最適化では、切り捨て係数δを用いた適応的サンプリング、オブジェクト境界付近での高解像度、およびメッシュプロキシを用いた効率的なレンダリングと勾配計算を実施する。
  • 収束を加速し、メモリ使用量を低減し、初期値が不十分な場合の耐性を高めるために、複数の解像度レベルで検出を処理するマルチスケールピラミッド方式を採用する。

実験結果

リサーチクエスチョン

  • RQ13次元バウンディングボックスの投影に基づく2次元検出フィルタリングは、初期3次元形状推定の品質を向上させることができるか?
  • RQ2ノイズが多いまたは不完全な検出に対して、固定Kクラスタリングと比較して、ディリクレ過程ベースのクラスタリングはどれほど耐障害性が高いか?
  • RQ3点群とSDF表現の共同最適化は、再構築精度と効率性をどの程度向上させるか?
  • RQ4適応的サンプリングとピラミッドベースの最適化は、精度を損なわずに実行時間を著しく短縮できるか?
  • RQ5本手法は、真値の3次元形状が与えられた実世界のマルチビューRGBDシーケンスにおいて、どの程度の性能を示すか?

主な発見

  • Redwood-OSにおけるアブレーションスタディでは、遮蔽されたビューを3次元バウンディングボックスの投影に基づいてフィルタリングすることで、平均チェンバーディスタンスが12.17 cmから10.57 cmに低下した。
  • 提案手法はRedwood-OSデータセットで平均チェンバーディスタンス10.57 cmを達成し、先行手法と比較して優れた精度を示した。
  • スパース最適化ステージは1イテレーションあたり0.07秒で実行され、PMO(12.59秒/イテレーション)の2桁分速く、また高密度最適化(4.96秒/イテレーション)よりも高速である。
  • 共同埋め込みアーキテクチャにより、幾何学的およびトポロジカルな詳細を両表現間で保持する共有64次元コード空間を学習することで、効果的な形状再構築が可能になった。
  • Redwood-OSデータセットにおける定性的な結果から、FroDOはスパースCOLMAP、高密度COLMAP、KinectFusionよりも正確で完全な3次元再構築を生成していることが確認された。
  • ∂Gd/∂zの可視化により、個々のコード成分の変化がオブジェクトの複数の領域に影響を与えることが示され、モデルが形状コードの変化に感受性を持つことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。