[論文レビュー] Towards Domain-agnostic Depth Completion
本稿では、モバイル端末のToFおよびLiDAR、マルチビュー再構築を含む多様なセンサーからの疎でノイジーかつ低解像度の深度マップを、ロバストに補完できるドメインに依存しない深度補完手法を提案する。単一画像深度予測ネットワークをデータ駆動的プライアとして活用することで、多様な合成された疎らかさパターンのトレーニングとノイズ耐性の最適化を組み合わせ、SOTA手法を上回るクロスドメイン一般化性能を達成し、新たに設計された疎らかさおよびノイズ耐性のベンチマークでも優れた性能を示す。
Existing depth completion methods are often targeted at a specific sparse depth type and generalize poorly across task domains. We present a method to complete sparse/semi-dense, noisy, and potentially low-resolution depth maps obtained by various range sensors, including those in modern mobile phones, or by multi-view reconstruction algorithms. Our method leverages a data-driven prior in the form of a single image depth prediction network trained on large-scale datasets, the output of which is used as an input to our model. We propose an effective training scheme where we simulate various sparsity patterns in typical task domains. In addition, we design two new benchmarks to evaluate the generalizability and the robustness of depth completion methods. Our simple method shows superior cross-domain generalization ability against state-of-the-art depth completion methods, introducing a practical solution to high-quality depth capture on a mobile device. The code is available at: https://github.com/YvanYin/FillDepth.
研究の動機と目的
- NYU や KITTI のような特定の疎らかさパターンに最適化されているが、他のドメインに一般化能力が低い既存の深度補完手法の課題を解決する。
- モバイルデバイスやSLAM/SfMパイプラインから得られる実世界の深度キャプチャで一般的なセンサーノイズや外れ値に対して、よりロバストな性能を向上させる。
- 従来のNYUやMatterport3Dデータセットにとどまらない、多様な疎らかさパターンとノイズレベルを想定した新しいベンチマークを設計し、一般化性能の評価を強化する。
- 再トレーニングなしに、複数のセンサータイプ(例:iPhone、Pixel、Huawei)をカバーする1つのモデルで一般化を実現する。
- RGBと疎な深度入力のみを用いて、低コストのモバイルデバイス向けに実用的で高品質な深度補完ソリューションを提供する。
提案手法
- 事前に訓練済みの単一画像深度予測ネットワーク(例:Yin et al. [49])を用いて相対的深度プライアを生成し、これを補完ネットワークにおけるガイドマップとして利用する。
- 実際のセンサ動作に基づいて、Unpaired FOV、Sparse ToF、Short Range などの多様な疎らかさパターンを模擬することで、データ拡張を実施し、ドメイン一般化性能を向上させる。
- シーンやセンサの多様性に耐性を持つよう、複数の深度ソース(例:NYU、ScanNet、DIODE)を組み合わせたトレーニング方式を導入する。
- NYU動画をCOLMAPで処理して生成した合成ノイズ付き深度マップを用いてトレーニングすることで、実世界のSLAM/SfMエラーを模擬し、ノイズ耐性を強化する。
- 1回のネットワーク実行の出力を次の段階のガイドマップとして再利用する反復的リファインメント戦略を採用し、詳細回復性能を向上させる。
- モバイルプラットフォームでのリアルタイム推論を想定し、軽量で効率的なアーキテクチャ(ESANet-R34-NBt1D)を採用する。
実験結果
リサーチクエスチョン
- RQ1あるドメインでトレーニングされた深度補完モデルが、異なるセンサー(例:モバイルToF vs. LiDAR)からの未観測の疎らかさパターンに対しても効果的に一般化できるか?
- RQ2学習された単一画像深度プライアを組み込むことで、疎な深度入力におけるノイズや外れ値に対して、どの程度性能が向上するか?
- RQ3既存のベンチマークが実世界の耐性を適切に評価できていない点はどこまで顕在化され、新しいベンチマークは実用的課題をどの程度正確に模擬できるか?
- RQ4ドメインランダマイゼーションとマルチソースデータを用いた1つのモデルが、多様なセンサータイプとノイズレベルでSOTA性能を達成できるか?
- RQ5データ駆動的プライアの使用が、完成した深度マップにおける細部回復と構造的一致性をどの程度向上させるか?
主な発見
- NLSPN や Senushkin et al. と比較して、未学習の疎らかさパターン(例:Unpaired FOV、Sparse ToF、Short Range)において優れたクロスドメイン一般化性能を達成した。
- NoisySparsity ベンチマークにおいて、COLMAPで生成されたノイズ付き深度を用いた16のNYUシーンで、あらゆる条件下でベースラインを常に上回り、強いノイズ耐性を示した。
- 定量的結果では、iPhone、Pixel、Huawei端末の深度入力において、NLSPN や Senushkin et al. よりも顕著に細かな幾何的詳細やテクスチャ構造を回復できた。
- 再トレーニングなしに、実世界のモバイル深度センサーに対しても良好な一般化性能を示し、全テスト端末モデルでSOTA手法を上回った。
- アブレーションスタディにより、データ駆動的プライアと多様なデータ拡張の組み合わせが、性能と耐性の両面で顕著な向上をもたらすことが確認された。
- 新規ベンチマーク(GeneralSparsity および NoisySparsity)は、既存手法の限界を効果的に露呈させ、提案手法の耐性および一般化能力を妥当に検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。