Skip to main content
QUICK REVIEW

[論文レビュー] Improving 360 Monocular Depth Estimation via Non-local Dense Prediction Transformer and Joint Supervised and Self-supervised Learning

Ilwi Yun, Hyuk-Jae Lee|arXiv (Cornell University)|Sep 22, 2021
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、データ不足と既存手法における不安定性を克服するため、非局所的密集予測変換器と統合的教師あり・自己教師あり学習を用いた新規な360°単眼深度推定手法を提案する。重力に沿った動画を自己教師あり学習に活用し、教師あり学習と組み合わせることで、複数のベンチマークで最先端の性能を達成した。一般化性能と深度再構成精度が向上し、特にオクルージョンやテクスチャレスな領域を含む困難なシーンでも優れた結果を示した。

ABSTRACT

Due to difficulties in acquiring ground truth depth of equirectangular (360) images, the quality and quantity of equirectangular depth data today is insufficient to represent the various scenes in the world. Therefore, 360 depth estimation studies, which relied solely on supervised learning, are destined to produce unsatisfactory results. Although self-supervised learning methods focusing on equirectangular images (EIs) are introduced, they often have incorrect or non-unique solutions, causing unstable performance. In this paper, we propose 360 monocular depth estimation methods which improve on the areas that limited previous studies. First, we introduce a self-supervised 360 depth learning method that only utilizes gravity-aligned videos, which has the potential to eliminate the needs for depth data during the training procedure. Second, we propose a joint learning scheme realized by combining supervised and self-supervised learning. The weakness of each learning is compensated, thus leading to more accurate depth estimation. Third, we propose a non-local fusion block, which can further retain the global information encoded by vision transformer when reconstructing the depths. With the proposed methods, we successfully apply the transformer to 360 depth estimations, to the best of our knowledge, which has not been tried before. On several benchmarks, our approach achieves significant improvements over previous works and establishes a state of the art.

研究の動機と目的

  • 360°等距離円形深度データの不足と低品質が教師あり学習の性能を制限する問題に対処する。
  • 反射面やテクスチャレスな表面からの自己教師あり360°深度学習で一般的に見られる不安定さや一意でない解の問題を克服する。
  • 各手法の欠点を補完するため、教師ありと自己教師あり信号を統合した共同学習スキームを導入する。
  • 視覚変換器におけるグローバル特徴の保持を向上させるために、非局所融合ブロック(NLFB)を設計する。
  • 大規模なラベル付きデータが限られる中で、視覚変換器を360°深度推定に効果的に訓練可能にする。

提案手法

  • 重力に沿った動画シーケンスのみを用いた自己教師あり学習手法を提案し、学習中に真値深度のアノテーションを不要にする。
  • 教師あり損失($\mathcal{L}_{pix} + \mathcal{L}_{grad}$)と自己教師あり損失($\mathcal{L}_{I} + \mathcal{L}_{D}$)を統合した共同学習目的関数を導入し、より頑健で正確な推定を実現する。
  • 特徴マップ内の長距離依存関係を統合することで、グローバルな文脈モデリングを強化する非局所融合ブロック(NLFB)を設計する。
  • 直線的画像で事前学習された視覚変換器バックボーンを用いて特徴を初期化し、限られた監視信号のもとで360°データに対する有効なファインチューニングを可能にする。
  • 予測深度と隣接フレームからのワープされた特徴間の一貫性損失($\mathcal{L}_{D}$)を適用し、自己教師あり学習の安定性を向上させる。
  • マルチスケールの監視戦略を採用し、複数レベルの監視により特徴表現と深度の詳細を向上させる。

実験結果

リサーチクエスチョン

  • RQ1重力に沿った動画シーケンスにおける自己教師あり学習は、360°単眼深度推定において真値深度アノテーションの必要性を排除できるか?
  • RQ2教師ありと自己教師あり学習を統合することで、単独の手法よりも精度と安定性の高い深度予測が達成できるか?
  • RQ3非局所融合ブロックは、視覚変換器におけるグローバル文脈モデリングを360°密集深度推定で向上させられるか?
  • RQ4共同学習スキームは、教師あり学習における不正確または欠落した真値深度によって生じる誤差をどのように緩和できるか?
  • RQ5先行の最先端手法と比較して、提案手法は未観測のシーンやデータセットへの一般化性をどの程度向上させられるか?

主な発見

  • 提案手法は、3D60やStructure3Dを含む複数のベンチマークで最先端の性能を達成し、すべての指標で先行手法を上回った。
  • 教師ありと自己教師あり損失の両方を統合した共同学習により、特にテクスチャレスまたはオクルージョン領域での深度推定精度が顕著に向上した。
  • 非局所融合ブロック(NLFB)は、グローバル文脈を保持することで深度再構成を向上させ、アーチファクトを低減し、物体境界の整合性を改善した。
  • 定性的な結果から、共同学習スキームは窓と壁、ソファと床を正しく区別している一方で、ベースライン手法はこのような状況で失敗していることが明らかになった。
  • アブレーションスタディの結果、教師あり損失と組み合わせることで、自己教師あり損失($\mathcal{L}_{I}$ と $\mathcal{L}_{D}$)が、曖昧またはノイズの多い真値を扱う場合に顕著に性能を向上させた。
  • 完全な共同目的関数とNLFBを用いて訓練されたモデルが、すべてのテストセットで最良の結果を達成した。各コンponentが個別に、および組み合わせて有効であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。