Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Training of Hybrid CNN-CRF Models for Stereo

Patrick Knöbelreiter, Christian Reinbacher|TUGraz OPEN Library (Graz University of Technology)|Nov 30, 2016
Advanced Vision and Imaging参考文献 37被引用数 6
ひとこと要約

この論文では、構造的SVMフレームワークを用いて一様コストとペairワイズコストを同時に学習する、エンド・ツー・エンドで微分可能なハイブリッドCNN-CRFモデルを提案する。手動で設計されたコンponentsを深層特徴に置き換え、高速なデュアル・ブロック降下推論を用いることで、中間部屋2014およびKitti 2015ベンチマークで後処理を一切行わずに競争力ある性能を達成し、浅いネットワークでも一般化性能と境界精度が向上することを示している。

ABSTRACT

We propose a novel and principled hybrid CNN+CRF model for stereo estimation. Our model allows to exploit the advantages of both, convolutional neural networks (CNNs) and conditional random fields (CRFs) in an unified approach. The CNNs compute expressive features for matching and distinctive color edges, which in turn are used to compute the unary and binary costs of the CRF. For inference, we apply a recently proposed highly parallel dual block descent algorithm which only needs a small fixed number of iterations to compute a high-quality approximate minimizer. As the main contribution of the paper, we propose a theoretically sound method based on the structured output support vector machine (SSVM) to train the hybrid CNN+CRF model on large-scale data end-to-end. Our trained models perform very well despite the fact that we are using shallow CNNs and do not apply any kind of post-processing to the final output of the CRF. We evaluate our combined models on challenging stereo benchmarks such as Middlebury 2014 and Kitti 2015 and also investigate the performance of each individual component.

研究の動機と目的

  • ステレオマッチングのための統合的でエンド・ツー・エンドで微分可能なハイブリッドCNN-CRFモデルを構築し、深層特徴と構造的CRF推論を統合する。
  • データから直接ロバストな一様コストとペairワイズコストを学習することで、後処理のヒューリスティクスに依存しないようにする。
  • 構造的出力学習を用いてCNN部とCRFパラメータを同時に学習することで、一般化性能と解釈可能性を向上させる。
  • 設計されたCRFと学習されたコストを組み合わせたモデルが、広範な後処理を必要とする複雑な深層ネットワークを上回ることを示す。
  • 浅いCNNとCRFを組み合わせることで、パラメータ数を減らし、過学習を軽減しながらも競争力ある性能を達成できることを示す。

提案手法

  • 一様-CNNが左・右のステレオ画像から局所的特徴を抽出し、相関層を介して照合コストボリュームを形成する。このボリュームがCRFにおける一様ポテンシャルとして用いられる。
  • ペアワイズ-CNNがCRF用のコントラスト感受性エッジ重みを学習し、従来の手作業で設計された正則化項に代わり、画像コンテンツに基づく適応的スムージングを可能にする。
  • CRFは空間的依存関係をモデル化するための4連結グリッド構造を用い、画像全体にわたる視差ラベルを同時に最適化する。
  • 推論は高速で高並列性を持つデュアル・ブロック降下アルゴリズムを用い、わずかなイテレーションでニアリアルタイム性能を達成する。
  • エンド・ツー・エンド学習は構造的出力サポートベクターマシン(SSVM)を用い、非微分可能なCRF推論を逆伝播可能にするために部分勾配近似を適用する。
  • モデルは切り出しパッチではなく、完全な画像上で学習されるため、シーン全体における推論性能の直接最適化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドCNN-CRFモデルは、エンド・ツー・エンドで微分可能かつ一様コストとペアワイズコストを同時に学習できるか?
  • RQ2構造的SVMで学習することで、パッチベースの学習や最尤推定と比較して一般化性能と性能が向上するか?
  • RQ3サブピクセル補正やオクルージョン処理などの後処理を一切行わずに、浅いCNN-CRFモデルが競争力ある結果を達成できるか?
  • RQ4CNNで学習されたペアワイズコストは、従来のコントラスト感受性正則化項と比較して、境界精度とロバスト性に優れているか?
  • RQ5浅いネットワークを用いた場合、CRF部が過学習をどれほど軽減し、一般化性能を向上させるか?

主な発見

  • 提案手法は、CNNベースの手法の中でも中間部屋2014ベンチマークで最小の平均二乗誤差(RMS)を達成し、7層のCNNを用いてもRMSが6.01である。
  • Kitti 2015ベンチマークでは、bad3誤差が2.93であり、困難な実世界シーンでも優れた性能を示している。
  • 定性的な比較において、物体境界の明確な区別がなされており、競合手法が過学習を示す上部画像領域での漏れが最小限に抑えられている。
  • 後処理が存在しないことによるbad2誤差のわずかな上昇は、大きな誤差ではなく、主に量子化アーチファクトに起因すると考えられる。
  • CRF層は過学習を顕著に軽減し、浅いCNN(3〜7層)でも強力な性能を発揮する。これは、より高いデータ効率と一般化性能を示している。
  • オクルージョンや照明変化に対してもロバストである。明示的なオクルージョンモデルがなくても、学習されたCRF正則化項が幾何的事前知識を暗黙的に捉えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。