Skip to main content
QUICK REVIEW

[論文レビュー] Video Instance Segmentation

Linjie Yang, Yuchen Fan|arXiv (Cornell University)|May 12, 2019
Advanced Image and Video Retrieval Techniques参考文献 36被引用数 15
ひとこと要約

この論文は、動画内のオブジェクト検出、インスタンスセグメンテーション、トラッキングを統合する新しいタスク「ビデオインスタンスセグメンテーション」を導入する。著者らは、外的なメモリにインスタンス埋め込みを保持するトラッキングブランチを備えた新しい手法MaskTrack R-CNNを提案し、外見、動き、カテゴリの手がかりを用いてフレーム間のインスタンス関連付けを実現した。2,883本の高解像度ビデオと131,000枚のマスクを含む新しいYouTube-VISベンチマークで30.3 APを達成した。

ABSTRACT

In this paper we present a new computer vision task, named video instance segmentation. The goal of this new task is simultaneous detection, segmentation and tracking of instances in videos. In words, it is the first time that the image instance segmentation problem is extended to the video domain. To facilitate research on this new task, we propose a large-scale benchmark called YouTube-VIS, which consists of 2883 high-resolution YouTube videos, a 40-category label set and 131k high-quality instance masks. In addition, we propose a novel algorithm called MaskTrack R-CNN for this task. Our new method introduces a new tracking branch to Mask R-CNN to jointly perform the detection, segmentation and tracking tasks simultaneously. Finally, we evaluate the proposed method and several strong baselines on our new dataset. Experimental results clearly demonstrate the advantages of the proposed algorithm and reveal insight for future improvement. We believe the video instance segmentation task will motivate the community along the line of research for video understanding.

研究の動機と目的

  • 動画内のオブジェクト検出、セグメンテーション、トラッキングを統合する新しいコンピュータビジョンタスクとして、ビデオインスタンスセグメンテーションを明確に定義し、その可能性を調査すること。
  • 従来、分野の進展を妨えてきた大規模かつ高品質なビデオインスタンスセグメンテーションデータセットの不足を解消すること。
  • フレーム間でインスタンスセグメンテーションとトラッキングを同時に実行する新しいディーブラーニングフレームワーク、MaskTrack R-CNNを提案すること。
  • YouTube-VISデータセットを用いてビデオインスタンスセグメンテーションのベンチマークを確立し、今後の手法の評価と比較を可能にすること。

提案手法

  • インスタンス埋め込みを外部メモリに保持するトラッキングブランチをMask R-CNNに追加し、フレーム間のマッチングを実現する。
  • 検出信頼度、ボクセルIoU、カテゴリの一貫性を組み合わせたマッチングスコア $ v_i $ を導入し、フレーム間でのインスタンス関連付けを実現する。
  • 正解ボクシングボックスからのRoIAlign特徴を用いて外見的類似度を計算し、トラッキングにおける堅牢なインスタンス関連付けを実現する。
  • 予測されたインスタンスを外部メモリに格納し、学習された類似度関数を用いて以降のフレーム内のオブジェクトとマッチングする。
  • 空間的(IoU)、意味的(カテゴリ)、検出信頼度のヒントをソフト制約として適用し、トラッキングの堅牢性を向上させる。
  • 2段階の推論パイプラインを設計:まず各フレームの検出とマスクを予測し、次にトラッキングブランチを用いてフレーム間関連付けを実行する。

実験結果

リサーチクエスチョン

  • RQ1インスタンスセグメンテーションとトラッキングをどのように統合的に最適化することで、精度と一貫性を向上させられるか?
  • RQ2空間的、外見的、動き、カテゴリの手がかりは、効果的なビデオインスタンストラッキングにおいて果たす役割は何か?
  • RQ3ビデオインスタンスセグメンテーションの性能は、画像レベルの検出品質とフレーム間関連付けのどちらに依存しているか?
  • RQ4既存の関連タスク(例:動画オブジェクト検出やセグメンテーション)の手法は、どの程度ビデオインスタンスセグメンテーションに適応可能か?
  • RQ5ビデオインスタンスセグメンテーションにおける主なボトルネックは何か、そしてモデル設計と学習によってどのように克服できるか?

主な発見

  • 提案されたMaskTrack R-CNNは、YouTube-VIS検証セットで30.3 APを達成し、強力なベースラインを著しく上回った。
  • ボクシングボックスIoUとカテゴリの一貫性の手がかりが性能に最も寄与しており、これらを除去するとAPが約5%低下した。
  • 検出信頼度スコアは僅かな改善しかもたらさず、空間的および意味的一貫性がより重要であることを示している。
  • 画像レベルの予測が主なボトルネックである:正解の画像レベルアノテーションを用いても、性能は78.7 APにとどまり、改善の余地が大きいことが示された。
  • アイデンティティオラクル(正解のIDを用いる)はMaskTrack R-CNNをわずかに上回るにとどまり、トラッキングが主な制限要因ではないことを示唆している。
  • アブレーションスタディにより、検出、IoU、カテゴリ、外見の4つの手がかりを併用することで最良の性能が得られ、すべての手がかりを用いることで30.3 APを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。