Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Silhouette-based Semantic Scene Change Detection

Ken Sakurada, Mikiya Shibuya|arXiv (Cornell University)|Nov 29, 2018
Remote-Sensing Image Classification参考文献 51被引用数 7
ひとこと要約

本論文は、シアンズ相関ネットワーク(CSCDNet)とスレートベースのセマンティックネットワーク(SSCDNet)を用いて、変化検出とセマンティックラベリングを分離することで、弱教師付きのセマンティックシーン変化検出フレームワークを提案する。既存のセグメンテーションデータセットで訓練し、アングルに強い変化検出を導入することで、PCDデータセットで最先端の性能を達成し、ノイズの多い変化マスクであっても効果的なセマンティック変化検出が可能になる。これは新たにリリースされたPSCDベンチマークデータセットでも検証された。

ABSTRACT

This paper presents a novel semantic scene change detection scheme with only weak supervision. A straightforward approach for this task is to train a semantic change detection network directly from a large-scale dataset in an end-to-end manner. However, a specific dataset for this task, which is usually labor-intensive and time-consuming, becomes indispensable. To avoid this problem, we propose to train this kind of network from existing datasets by dividing this task into change detection and semantic extraction. On the other hand, the difference in camera viewpoints, for example, images of the same scene captured from a vehicle-mounted camera at different time points, usually brings a challenge to the change detection task. To address this challenge, we propose a new siamese network structure with the introduction of correlation layer. In addition, we collect and annotate a publicly available dataset for semantic change detection to evaluate the proposed method. The experimental results verified both the robustness to viewpoint difference in change detection task and the effectiveness for semantic change detection of the proposed networks. Our code and dataset are available at https://kensakurada.github.io/pscd.

研究の動機と目的

  • セマンティックシーン変化検出のための大規模かつアノテート済みデータセットの不足に取り組むこと。これらは作成に費用がかかる。
  • 専用で手間のかかるデータセットへのエンドツーエンドのトレーニングを必要とせずに、セマンティック変化検出を可能にすること。
  • 車両搭載カメラ画像における視点変化への耐性を高めること。これは変化検出における主要な課題である。
  • 変化検出とセマンティックラベリングを分離することで、より良い汎化性能とトレーニング効率を実現する二段階フレームワークを開発すること。
  • 公開可能な街路レベルのセマンティック変化検出データセット(PSCD)を初めて作成・リリースし、ベンチマーク化すること。

提案手法

  • 本手法は二段階パイプラインを採用する。まず、相関層を介して視点差に強い変化検出を実現する、相関付きシアンズ変化検出ネットワーク(CSCDNet)が画像ペアを処理し、変化確率マスクを生成する。
  • 次に、SSCDNetは画像ペアと推定された変化マスクを入力として受け取り、各画像のピクセル単位のセマンティックラベルを予測する。これはMapillary Vistasなどのセマンティックセグメンテーションデータセットからの合成データで訓練される。
  • SSCDNetのトレーニング中に変化マスクに対してデータ拡張を適用することで、変化検出出力の誤りに対する耐性を向上させる。
  • CSCDNetはPCDデータセットでトレーニングされ、視点に強い変化検出を実現し、同ベンチマークで最先端の性能を達成する。
  • SSCDNetは、セマンティックセグメンテーションアノテーションから変化検出マスクを合成することで弱教師付きで訓練され、シーン変化の直接ラベリングを回避する。
  • 変化マスクが不完全であっても、拡張されたマスクを用いたトレーニングにより検出誤りを補正する能力を学習することで、セマンティック変化検出が可能になる。

実験結果

リサーチクエスチョン

  • RQ1既存のセマンティックセグメンテーションデータセットからの弱教師付き情報のみで、セマンティックシーン変化検出を効果的に訓練できるか?
  • RQ2車両搭載カメラ画像における大きな視点変化に耐性を持つ変化検出ネットワークはどのように実現できるか?
  • RQ3変化検出マスクの精度が、最終的なセマンティック変化検出システムの性能にどの程度影響を及えるか?
  • RQ4変化検出とセマンティックラベリングを分離する二段階アプローチは、希少でアノテート済みの変化検出データセットへのエンドツーエンドトレーニングを必要とせずに、競争力のある性能を達成できるか?
  • RQ5完全なセマンティック変化検出データセットが利用可能な場合、本手法はエンドツーエンド学習と比べてどの程度の性能を示すか?

主な発見

  • 相関層を備えた提案されたCSCDNetは、パノラマ変化検出(PCD)データセットで最先端の性能を達成し、視点差の影響を効果的に扱っている。
  • 変化マスクに誤りがある状況下で、マスクにデータ拡張を適用したSSCDNetはPSCDデータセットでmIoU 0.283を達成し、拡張なしでは0.223にとどまる。
  • PSCDデータセットにおいて、全パイプライン(CSCDNet + SSCDNet)は平均交差率(mIoU)0.303を達成し、エンドツーエンドトレーニング(CSSCDNet)の0.322に近い性能を示した。
  • 正例マスクを用いてトレーニングされたSSCDNetはmIoU 0.283を達成し、変化マスクが正確であっても強力な性能を示した。
  • 本手法は変化検出誤りに対して耐性があることが示された:拡張されたトレーニングを経たSSCDNetは、入力マスクがノイズを含む状況で非拡張バージョンを上回る性能を示した。
  • PSCDデータセットの失敗事例は、広告看板や植生など、小さなオクルージョン物体のトレーニングデータ不足に起因しており、より多様なトレーニングデータの必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。