[論文レビュー] Self-Supervised Learning of Depth and Camera Motion from 360° Videos
本稿では、等角投影による歪みを解消するためのキューブマップ投影を用いて、360°動画における自己教師付きモノクロナル深度およびカメラモーション推定の手法を提案する。球面光度的一致性損失とポーズ的一致性損失を導入し、精度を向上させ、PanoSUNCGデータセットにおいて最先端の性能を達成するとともに、等角投影ベースラインよりも高速な推論を実現した。
As 360° cameras become prevalent in many autonomous systems (e.g., self-driving cars and drones), efficient 360° perception becomes more and more important. We propose a novel self-supervised learning approach for predicting the omnidirectional depth and camera motion from a 360° video. In particular, starting from the SfMLearner, which is designed for cameras with normal field-of-view, we introduce three key features to process 360° images efficiently. Firstly, we convert each image from equirectangular projection to cubic projection in order to avoid image distortion. In each network layer, we use Cube Padding (CP), which pads intermediate features from adjacent faces, to avoid image boundaries. Secondly, we propose a novel "spherical" photometric consistency constraint on the whole viewing sphere. In this way, no pixel will be projected outside the image boundary which typically happens in images with normal field-of-view. Finally, rather than naively estimating six independent camera motions (i.e., naively applying SfM-Learner to each face on a cube), we propose a novel camera pose consistency loss to ensure the estimated camera motions reaching consensus. To train and evaluate our approach, we collect a new PanoSUNCG dataset containing a large amount of 360° videos with groundtruth depth and camera motion. Our approach achieves state-of-the-art depth prediction and camera motion estimation on PanoSUNCG with faster inference speed comparing to equirectangular. In real-world indoor videos, our approach can also achieve qualitatively reasonable depth prediction by acquiring model pre-trained on PanoSUNCG.
研究の動機と目的
- 自律システムにおける360°動画向けの効果的な深度およびモーション推定手法の不足に対処すること。
- パノラマ動画処理における等角投影に内在する幾何的歪みを克服すること。
- 明示的な教師信号を必要とせず、動画シーケンスのみを活用する自己教師付き学習フレームワークの開発。
- 360°動画の球面幾何構造を活用して、深度およびモーション推定の精度を向上させること。
- ロボットおよび自律システムへの実装に適した、効率的でリアルタイムな推論を可能にすること。
提案手法
- 360°等角投影画像をキューブマップ投影に変換し、歪みを低減するとともに、特徴抽出の効率を向上させる。
- ネットワーク推論中に隣接するキューブ面間の特徴境界を処理するためのキューブパディング(CP)を導入する。
- 球面全体の視認領域において再構成誤差を計算する球面光度的一致性損失を提案し、境界への投影問題を回避する。
- 6枚のキューブ面全体にわたるポーズ的一致性を強制する新しいカメラポーズ的一致性損失を設計し、モーション推定のロバスト性を向上させる。
- 動画フレームからの自己教師信号を用いて、光度的再構成誤差を最小化する形でモデルをエンドツーエンドに訓練する。
- 合成データで事前学習したモデルを、実世界の360°動画で微調整することで、ゼロショット一般化を実現する。
実験結果
リサーチクエスチョン
- RQ1球面幾何を有する360°動画に、自己教師付き深度およびモーション推定を効果的に拡張できるか?
- RQ2精度および推論速度の観点から、キューブマップベース処理は等角投影処理に比べて優れているか?
- RQ3球面光度的一致性損失は、360°動画タスクにおいて従来の平面損失を上回れるか?
- RQ4キューブ面全体にわたるポーズ的一致性の強制は、モーション推定のロバスト性を向上させるか?
- RQ5合成データで事前学習したモデルは、実世界の360°動画シナリオに一般化可能か?
主な発見
- 提案手法はPanoSUNCGデータセットにおいて最先端の深度予測性能を達成し、絶対相対誤差(Abs Rel)が0.337を記録した。
- RMSEが8.589に低下し、δ<1.25指標が0.647に向上し、全閾値範囲でより高い深度精度を示した。
- カメラモーション推定では回転誤差が6.98°、並進誤差が0.025にまで低下し、ベースラインおよびアブレーションバージョンを上回った。
- 球面光度的一致性損失およびポーズ的一致性損失の両方を含む完全なモデルは、これらのコンponentsを欠いたアブレーションと比べて顕著に優れた性能を示した。
- キューブマップ表現のおかげで計算負荷が低減したため、高解像度下で等角投影ベースラインよりも200%以上高速な推論が実現された。
- RICOH THETA Vの記録データで微調整した後、実世界の360°動画に対しても良好な一般化性能を示し、質的に妥当な深度予測を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。