Skip to main content
QUICK REVIEW

[論文レビュー] CAM-Convs: Camera-Aware Multi-Scale Convolutions for Single-View Depth

José M. Fácil, Benjamin Ummenhofer|arXiv (Cornell University)|Apr 3, 2019
Advanced Vision and Imaging参考文献 50被引用数 6
ひとこと要約

この論文では、1枚の画像からの深度推定のための深層ニューラルネットワークにカメラの内因パラメータを組み込むことで、異なるカメラモデル間で一般化できる新しい畳み込み層CAM-Convsを提案する。特徴マップとカメラパラメータを統合することで、再訓練なしに多様なカメラで高い精度を維持できる1つのネットワークを実現し、未学習のカメラ内因パラメータに対して、最先端の手法を著しく上回る性能を発揮する。

ABSTRACT

Single-view depth estimation suffers from the problem that a network trained on images from one camera does not generalize to images taken with a different camera model. Thus, changing the camera model requires collecting an entirely new training dataset. In this work, we propose a new type of convolution that can take the camera parameters into account, thus allowing neural networks to learn calibration-aware patterns. Experiments confirm that this improves the generalization capabilities of depth prediction networks considerably, and clearly outperforms the state of the art when the train and test images are acquired with different cameras.

研究の動機と目的

  • 異なるカメラモデルからの画像をテストした際の、1枚の画像からの深度推定ネットワークにおける一般化の欠如に対処すること。
  • 再訓練やアーキテクチャの変更なしに、複数のカメラ内因パラメータで良好に動作する1つの深度予測ネットワークを可能にすること。
  • 現在のネットワークが、訓練データに多様なデータセットを含んでも特定のカメラパラメータに過学習してしまうという制限を克服すること。
  • 新しいカメラモデルでの性能劣化を伴わずに、あらゆるカメラからの画像を効率的に活用できるようにすること。

提案手法

  • カメラ内因パラメータ(焦点距離、主点)を各層の特徴マップに連結する、変更を加えた畳み込み層であるCAM-Convsを導入する。
  • ネットワークの初期段階でカメラパラメータを統合することで、特徴抽出段階でカメラ固有のパターンを学習できるようにする。
  • マルチスケールエンコーダ・デコーダアーキテクチャを採用し、複数のレベルにCAM-Convsを適用することで、空間的および幾何的整合性を保持する。
  • NYUv2、KITTI、MegaDepthなど、異なる内因パラメータとデータ分布を持つ複数のデータセットの混合データでネットワークを学習する。
  • MegaDepthのように、スケール不変の真値を持つデータセットに対しては、絶対的深度スケールに偏らないよう、スケール不変損失関数を適用する。
  • 画像のクロップやリサイズを用いてトレーニングデータを拡張し、センサーサイズや焦点距離の変動を模擬することで、カメラパラメータのばらつきを増加させる。

実験結果

リサーチクエスチョン

  • RQ1再訓練なしに、1つの深度予測ネットワークが異なるカメラモデル間で一般化できるか?
  • RQ2ネットワークアーキテクチャにカメラ内因パラメータを統合することで、未学習のカメラ内因パラメータへの一般化が向上するか?
  • RQ3異なる内因パラメータを持つ多様なカメラで学習したネットワークが、トレーニング時に見られなかった別のカメラからのテスト画像でも高い精度を維持できるか?
  • RQ4標準的なネットワークにカメラパラメータ情報が欠落している場合、カメラパラメータが変化した際に性能が劣化するか?

主な発見

  • CAM-Convsは一般化性能を顕著に向上させる:NYUv2で独自に学習した最先端モデルとは対照的に、6種類の異なるカメラ設定(未学習のものも含む)において、平均誤差と分散が著しく低い結果を達成した。
  • NYUv2を含まない複数のデータセットで学習したネットワークは、NYUv2のテストセットでもSOTAモデル[21]を上回る性能を示したが、これはNYUv2で学習していないにもかかわらず、強力な一般化能力を示している。
  • CAM-Convsを搭載したネットワークは、異なる画像解像度やカメラ内因パラメータに対しても一貫した深度予測を維持しているが、ベースラインモデル[21]は一般化に失敗し、内因パラメータの変化に対して高い誤差分散を示した。
  • カメラパラメータの統合がなければ、内因パラメータが異なる混合データセットで学習した際にネットワークが収束しないため、キャリブレーション認識学習の必要性が浮き彫りになった。
  • 定性的な結果から、CAM-Convsは、NYUv2、KITTI、MegaDepthの各データセットにおいて、画像をクロップまたはリサイズして異なるカメラを模擬しても、安定的かつ正確な深度予測を生成することがわかった。
  • 本手法により、さまざまなカメラからの現実世界の多様な画像を効果的に活用でき、新しいカメラモデルでも性能劣化が生じない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。