Skip to main content
QUICK REVIEW

[論文レビュー] Joint Background Reconstruction and Foreground Segmentation via A Two-stage Convolutional Neural Network

Xu Zhao, Yingying Chen|arXiv (Cornell University)|Jul 24, 2017
Video Surveillance and Tracking Methods参考文献 3被引用数 8
ひとこと要約

本稿では、動画シーケンスにおいて背景画像を同時に再構築し、前景オブジェクトをセグメンテーションする2段階のエンドツーエンドのディープ畳み込みニューラルネットワークを提案する。背景再構築にエンコーダ・デコーダネットワークを、再構築された背景と現在のフレームを統合するマルチチャネル畳み込みニューラルネットワーク(MCFCN)を用いることで、意味的文脈と動きの手がかりを両方活用し、CDNet 2014で最先端手法よりも4.9%の向上を達成した。

ABSTRACT

Foreground segmentation in video sequences is a classic topic in computer vision. Due to the lack of semantic and prior knowledge, it is difficult for existing methods to deal with sophisticated scenes well. Therefore, in this paper, we propose an end-to-end two-stage deep convolutional neural network (CNN) framework for foreground segmentation in video sequences. In the first stage, a convolutional encoder-decoder sub-network is employed to reconstruct the background images and encode rich prior knowledge of background scenes. In the second stage, the reconstructed background and current frame are input into a multi-channel fully-convolutional sub-network (MCFCN) for accurate foreground segmentation. In the two-stage CNN, the reconstruction loss and segmentation loss are jointly optimized. The background images and foreground objects are output simultaneously in an end-to-end way. Moreover, by incorporating the prior semantic knowledge of foreground and background in the pre-training process, our method could restrain the background noise and keep the integrity of foreground objects at the same time. Experiments on CDNet 2014 show that our method outperforms the state-of-the-art by 4.9%.

研究の動機と目的

  • 夜間の照明、影、 camouflage された前景などの複雑なシーンにおける従来の非教師あり背景モデリング手法の限界を解消すること。
  • 古典的手法が手動で調整されたパrameter 依存であるのを回避し、教師ありエンドツーエンドのディープラーニングフレームワークを導入すること。
  • マルチタスク学習により、背景再構築とセグメンテーションを同時に最適化することで、前景セグメンテーションの精度を向上させること。
  • 事前学習から得られる意味的事前知識を組み込むことで、背景ノイズに対する耐性を高め、前景の整合性を保持すること。

提案手法

  • 訓練フレームから背景画像を再構築するためのディープなエンコーダ・デコーダサブネットワークを採用し、シーン構造に関する豊富な事前知識をエンコードする。
  • 再構築された背景画像を基準として、現在の入力フレームと連結し、セグメンテーションネットワーク用に6チャネルの入力を構成する。
  • 連結された入力を処理し、ピクセル単位の前景セグメンテーションを実行するマルチチャネル畳み込みニューラルネットワーク(MCFCN)を実装する。
  • 再構築損失(背景画像におけるL2損失)とセグメンテーション損失(F-measureに基づく損失)を組み合わせたマルチタスク損失を用いて、ネットワークを同時に最適化する。
  • ラベル付きデータでネットワークを事前学習し、前景および背景の意味的知識を埋め込むことで、一般化性能とノイズ耐性を向上させる。
  • 両サブネットワークを共有最適化でエンドツーエンドに訓練し、背景再構築と前景セグメンテーションの間で相互に改善を促進する。

実験結果

リサーチクエスチョン

  • RQ1背景再構築と前景セグメンテーションを同時に最適化することで、分離したモデリングに比べ、複雑な動画シーンにおける性能が向上するか?
  • RQ2再構築された背景画像を介して動き情報を組み込むことで、前景セグメンテーションの精度がどの程度向上するか?
  • RQ3意味的知識を用いた事前学習が、影や低照度といった困難な条件下での前景セグメンテーションの耐性にどのように影響するか?
  • RQ42段階のディープラーニングフレームワークが、ベンチマークデータセットにおいて最先端の非教師あり背景モデリング手法を上回るか?

主な発見

  • 提案手法は、CDNet 2014ベンチマークで最先端手法よりもF-measureで4.9%の相対的向上を達成した。
  • 2段階のネットワークに共同最適化を適用した場合、11のカテゴリのうち10でベースラインFCN(Baseline-2)を上回り、再構築された背景を入力として使用する利点を示した。
  • 夜間動画、一時的物体運動、赤外線動画などの困難なカテゴリでは、他の手法と比べ顕著な優位性を示し、一部のケースではF-measureが0.96を超えた。
  • 影領域における誤検出を低減し、より洗練された前景境界を生成しており、定性的な比較でも明確に確認された。
  • 共同最適化戦略により、2段階ネットワーク単体よりも2.36%向上し、完全な共同学習ではさらに2.54%向上した。サブネットワーク間の強い相互利益が示された。
  • 再構築された背景上でしきい値ベース分類を適用するベースライン手法はF-measureが0.6未満にとどまり、ディープラーニング分類器の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。