Skip to main content
QUICK REVIEW

[論文レビュー] SegStereo: Exploiting Semantic Information for Disparity Estimation

Guorun Yang, Hengshuang Zhao|arXiv (Cornell University)|Jul 31, 2018
Advanced Vision and Imaging参考文献 32被引用数 6
ひとこと要約

本論文は、セマンティックセグメンテーション特徴をステレオ視差推定に統合することで、特に曇りや模様のない領域において精度を向上させる、統合的なディーブラーニングフレームワークであるSegStereoを提案する。セマンティック特徴埋め込みとセマンティックソフトマックス損失を導入することで、教師ありおよび教師なし学習の両方を強化し、KITTIステレオベンチマークで最先端の性能を達成するとともに、CityScapesおよびFlyingThings3Dでも優れた結果を示した。

ABSTRACT

Disparity estimation for binocular stereo images finds a wide range of applications. Traditional algorithms may fail on featureless regions, which could be handled by high-level clues such as semantic segments. In this paper, we suggest that appropriate incorporation of semantic cues can greatly rectify prediction in commonly-used disparity estimation frameworks. Our method conducts semantic feature embedding and regularizes semantic cues as the loss term to improve learning disparity. Our unified model SegStereo employs semantic features from segmentation and introduces semantic softmax loss, which helps improve the prediction accuracy of disparity maps. The semantic cues work well in both unsupervised and supervised manners. SegStereo achieves state-of-the-art results on KITTI Stereo benchmark and produces decent prediction on both CityScapes and FlyingThings3D datasets.

研究の動機と目的

  • 従来の方法が局所的特徴の不足により失敗する、模様が少なく曇った領域における視差推定の不正確さという課題に対処すること。
  • 高レベルのセマンティック手がかりが、教師ありおよび教師なし学習の両設定において視差予測をガイドおよび安定化できるかどうかを調査すること。
  • セマンティックセグメンテーションと視差推定を統合的に最適化することで、より高い耐障害性と精度を実現する統一フレームワークを開発すること。
  • 実世界のステレオデータセットにおける予測誤差を低減するためのセマンティック正則化の有効性を評価すること。
  • KITTI、CityScapes、FlyingThings3Dを含む多様なデータセットにわたる一般化能力を示すこと。

提案手法

  • 視差推定における特徴抽出およびコストボリューム計算に、相関層を備えたResNetベースのエンコーダーを用いる。
  • 視差予測ブランチに空間的に整合されたセマンティック特徴マップを統合するセグメンテーションサブネットワークを導入する。
  • 一致するピクセル間のセマンティック一貫性を強制することで、予測の正則化にセマンティックソフトマックス損失を適用する。
  • 両方の予測(視差およびセマンティック)を完全畳み込み層として実装することで、エンドツーエンド学習を可能にする。
  • 教師ありおよび教師なし学習の両方をサポート:教師なしモードでは、光度的一致性損失とセマンティックソフトマックス損失を組み合わせる。教師ありモードでは、光度損失の代わりに回帰損失を適用する。
  • より深い特徴抽出(例:'conv1_3'および'conv5_4'層)と相関層のカーネルサイズの拡大(96)を実装した再設計アーキテクチャを用いて、KITTIでモデルの微調整を行う。

実験結果

リサーチクエスチョン

  • RQ1従来の方法が失敗する曇りや模様のない領域において、セマンティック手がかりが視差推定を顕著に改善できるか?
  • RQ2セマンティック特徴埋め込みは、教師ありと教師なしの両学習パラダイムにおいて、視差予測の耐障害性を向上させるのにどの程度有効か?
  • RQ3ソフトマックス損失によるセマンティック一貫性の統合が、多様なステレオデータセットにおける一般化性能を向上させるか?
  • RQ4統一モデルがエンドツーエンドの方法で視差推定とセマンティックセグメンテーションの両コンponentsを効果的に学習できるか?
  • RQ5KITTI、CityScapes、FlyingThings3Dといった標準ベンチマークにおいて、本手法は最先端のアプローチと比較してどの程度優れているか?

主な発見

  • SegStereoは、KITTIステレオ2015ベンチマークでエンドツーエンド平均誤差(EPE)1.76、D1誤差3.70という最先端の性能を達成した。
  • KITTI 2012ベンチマークでは、EPEが1.88、D1が4.07に低下し、特に困難な領域で従来手法を上回った。
  • SegStereoの教師なしバージョンは、CityScapesで古典的手法のSGMを上回り、優れたゼロショット一般化能力を示した。
  • FlyingThings3Dデータセットでは、教師ありのSegStereoモデルがEPE 1.45、D1 3.50を達成し、ResNetCorr(EPE: 3.50、D1: 8.45)や他の最先端手法を上回った。
  • 強化された特徴抽出(corr13)を備えた再設計されたSegStereoモデルは、KITTI 2015でEPEを1.88、D1を4.07に低下させ、詳細の保持が向上したことを示した。
  • 視覚的結果から、道路中央部や車両領域などの曇った領域においても、セマンティック一貫性を活用することで、SegStereoがより正確な視差マップを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。