Skip to main content
QUICK REVIEW

[論文レビュー] Visualizing the Invisible: Occluded Vehicle Segmentation and Recovery

Xiaosheng Yan, Yuanlong Yu|arXiv (Cornell University)|Jul 22, 2019
Generative Adversarial Networks and Image Synthesis参考文献 56被引用数 6
ひとこと要約

本論文は、実際の車両の部分的隠蔽を対象として、3Dモデルプールを用いたリアルなセグメンテーション補完と、高精度な外観再構成を実現するための反復的マルチタスクフレームワークを提案する。2パス共有ネットワークを用いたアプローチにより、高精細な外観生成が可能となり、新規の隠蔽車両データセットにおいて最先端の性能を達成した。また、実動画における隠蔽車両トラッキングの性能も顕著に向上させた。

ABSTRACT

In this paper, we propose a novel iterative multi-task framework to complete the segmentation mask of an occluded vehicle and recover the appearance of its invisible parts. In particular, to improve the quality of the segmentation completion, we present two coupled discriminators and introduce an auxiliary 3D model pool for sampling authentic silhouettes as adversarial samples. In addition, we propose a two-path structure with a shared network to enhance the appearance recovery capability. By iteratively performing the segmentation completion and the appearance recovery, the results will be progressively refined. To evaluate our method, we present a dataset, the Occluded Vehicle dataset, containing synthetic and real-world occluded vehicle images. We conduct comparison experiments on this dataset and demonstrate that our model outperforms the state-of-the-art in tasks of recovering segmentation mask and appearance for occluded vehicles. Moreover, we also demonstrate that our appearance recovery approach can benefit the occluded vehicle tracking in real-world videos.

研究の動機と目的

  • 実世界の画像における部分的隠蔽された車両の正確なセグメンテーションと外観回復の課題に取り組む。
  • 深層学習モデルと人間の視覚的認知の間のギャップを、見えない物体部分の推論において埋める。
  • 混雑またはごみが多く、隠蔽が一般的なシーンにおいて、車両トラッキングシステムの耐障害性を向上させる。
  • 視覚的忠実度を高めるために、セグメンテーションと外観回復を反復的に最適化する統合フレームワークを開発する。
  • 隠蔽車両の文脈におけるアモーダルセグメンテーションと外観回復を評価するための新規ベンチマークデータセットを構築する。

提案手法

  • インスタンス識別器(真のインスタンスマスクと一致)とオブジェクト識別器(生成マスクが実際の車両シルエットに似ていることを保証)の2つの結合型識別器を備えたセグメンテーション補完ネットワークを採用する。
  • 本物のシルエットを持つ敵対的サンプルを生成するための補助的3D車両モデルプールを導入し、セグメンテーション補完のリアルさと品質を向上させる。
  • 重み共有の2パスアーキテクチャを設計:1パス目は見えない部分の色を回復し、2パス目はフォアグラウンドの完全な穴埋めを実行して特徴学習を強化する。
  • 回帰的改善のために、回復結果を複数回ネットワークに再入力する反復的精錬を実施し、段階的にセグメンテーションと外観品質を向上させる。
  • 忠実度とリアルさのバランスを取るために、敵対的損失、L1/L2損失、および周波数的類似度(SSIM)を用いて、エンドツーエンドでフレームワークを訓練する。
  • 推論時には最初のパスのみを実行して効率的な外観生成を実現し、2番目のパスは知識蒸留による訓練強化を目的とする。

実験結果

リサーチクエスチョン

  • RQ1マルチタスクで反復的なフレームワークは、現在の最先端手法を上回るレベルで、隠蔽車両のアモーダルセグメンテーションと外観回復を同時に改善できるか?
  • RQ23Dモデルプールを用いたリアルな敵対的シルエットの生成は、セグメンテーション補完の品質向上にどの程度有効か?
  • RQ3重み共有の2パスアーキテクチャは、単一パス生成と比較して外観回復品質を向上させるか?
  • RQ4外観回復により、実動画シーケンスにおける隠蔽車両トラッキング性能はどの程度向上するか?
  • RQ5ユーザーの認知と視覚的妥当性の観点から、本手法は既存のアプローチと比較してどの程度優れているか?

主な発見

  • 人間による評価では、Deepfill、pix2pix、SeGAN、および自手法のうち、84.8%の参加者が自手法の結果を最良と選択した。
  • 合成データでは、2反復後、L1損失が0.0158、SSIMが0.9447を達成。pix2pix(L1: 0.0174、SSIM: 0.9410)およびSeGAN(L1: 0.0181、SSIM: 0.9371)を上回った。
  • 実世界の画像では、Vid-1で平均ピクセル誤差(APE)を34.60から8.32に、Vid-3で87.71から21.51に削減。平均オーバーラップ(AO)は、それぞれ0.6489から0.8072、0.3584から0.6755に向上した。
  • 外観回復モジュールによりトラッキング性能が向上し、KCFトラッカーは4つの実動画シーケンスで平均APEを75%削減した。
  • 重み共有の2パスネットワークは、単一パスベースラインと比較して、より高いSSIMと低いL1/L2損失を示し、外観回復品質の顕著な向上を裏付けた。
  • 3Dモデルに基づく敵対的サンプルの使用により、特に複雑な隠蔽状況下でも、よりリアルで構造的に正確なセグメンテーションマスクが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。