Skip to main content
QUICK REVIEW

[論文レビュー] FoveaNet: Perspective-aware Urban Scene Parsing

Xin Li, Zequn Jie|arXiv (Cornell University)|Aug 8, 2017
Advanced Neural Network Applications参考文献 34被引用数 9
ひとこと要約

FoveaNetは、車両搭載カメラの画像におけるスケールの不均一性を解消するため、カメラの視点幾何を明示的にモデル化する視点に配慮した深層学習フレームワークを提案する。畳み込みニューラルネットワークを用いて視点スコアを推定し、スケール正規化と視点に配慮したCRFを適用することで、CityscapesおよびCamVidで最先端の性能を達成し、小さな物体の境界誤差と大きな周辺物体における「破壊的」誤差を低減する。

ABSTRACT

Parsing urban scene images benefits many applications, especially self-driving. Most of the current solutions employ generic image parsing models that treat all scales and locations in the images equally and do not consider the geometry property of car-captured urban scene images. Thus, they suffer from heterogeneous object scales caused by perspective projection of cameras on actual scenes and inevitably encounter parsing failures on distant objects as well as other boundary and recognition errors. In this work, we propose a new FoveaNet model to fully exploit the perspective geometry of scene images and address the common failures of generic parsing models. FoveaNet estimates the perspective geometry of a scene image through a convolutional network which integrates supportive evidence from contextual objects within the image. Based on the perspective geometry information, FoveaNet "undoes" the camera perspective projection analyzing regions in the space of the actual scene, and thus provides much more reliable parsing results. Furthermore, to effectively address the recognition errors, FoveaNet introduces a new dense CRFs model that takes the perspective geometry as a prior potential. We evaluate FoveaNet on two urban scene parsing datasets, Cityspaces and CamVid, which demonstrates that FoveaNet can outperform all the well-established baselines and provide new state-of-the-art performance.

研究の動機と目的

  • 視点に起因するスケールの不均一性により、汎用的なセマンティックセグメンテーションモデルが都市風景画像で性能を発揮できない問題に対処する。
  • エゴセントリックカメラビューにおける遠くの小さな物体のパースリング失敗と、大きな近接物体における「破壊的」誤差を克服する。
  • 視点幾何を構造的事前知識として統合し、ピクセル単位およびインスタンス単位のパースニング精度を向上させる。
  • 視点推定、スケール正規化、および適応的CRF推論を統合した包括的なフレームワークを構築する。

提案手法

  • 畳み込みニューラルネットワーク(CNN)を用いて、各ピクセルの消失点への近接度を示す密集的な視点スコアを予測する視点推定ネットワーク(PEN)を学習する。
  • 視覚の焦点領域(画像中央部)のスケール正規化を適用し、遠くの小さな物体のスケールを統一することで、より信頼性の高いパースニングを実現する。
  • 二本の分岐を持つFCNアーキテクチャを設計:一般のセグメンテーションを処理する粗い分岐と、視点正規化された特徴を処理する焦点分岐。
  • 視点スコアを事前確率として用いる視点に配慮した密度型CRFモデルを導入し、境界を保持する適応的スムージングを可能にする。
  • 高い視点スコア(遠くの物体)のピクセルには弱いスムージング、低いスコア(近い物体)のピクセルには強いスムージングを適用する潜在関数を最適化することで、CRFを最適化する。
  • マルチスケールの監視とCRFベースの精練を用いて、CityscapesおよびCamVidでFoveaNet全体のアーキテクチャをエンド・ツー・エンドで微調整する。

実験結果

リサーチクエスチョン

  • RQ1エゴセントリックカメラで撮影された都市風景において、視点幾何をモデル化することで、セマンティックパースニングの性能が顕著に向上するか?
  • RQ2視点に配慮したスケール正規化は、透視投影における小さな遠方物体のパースニング精度にどのように影響するか?
  • RQ3標準のCRFと比較して、視点に配慮したCRFは、大きな周辺物体における「破壊的」セグメンテーション誤差をどの程度低減できるか?
  • RQ4都市風景におけるパースニングアーチファクトを低減するための事前知識として、視点推定は深度予測よりも効果的か?

主な発見

  • FoveaNetはCityscapesテストセットで最先端の性能を達成し、mIoUが89.3%、インスタンスレベルIoUが77.6%を記録し、先行する最先端手法を上回る。
  • Cityscapesでは、ベースラインのFCNと比較してインスタンスレベルIoU(iIoU)を最大5.2%向上させ、小さなスケールの物体の取り扱いが優れていることを示している。
  • CamVidでは、全体の正確度が93.3%、平均正確度が81.8%を達成し、最良のベースラインをそれぞれ1.7ポイントおよび3.7ポイント上回っている。
  • アブレーションスタディの結果、視点に配慮したCRFは、小さな物体を過剰にスムージングせずに「破壊的」誤差を低減しており、標準CRFおよび深度に配慮したCRFを上回る性能を示している。
  • 視点推定ネットワークは、グローバルなシーン幾何を効果的に捉えており、高い視点スコアはカメラからの距離が大きいことを示している。
  • 視点に配慮した正規化と適応的CRF推論の組み合わせにより、両データセットおよび複数の評価指標において一貫した性能向上が得られている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。