Skip to main content
QUICK REVIEW

[論文レビュー] CompFeat: Comprehensive Feature Aggregation for Video Instance Segmentation

Yang Fu, Linjie Yang|arXiv (Cornell University)|Dec 7, 2020
Video Surveillance and Tracking Methods参考文献 33被引用数 14
ひとこと要約

本稿では、フレームレベルおよびオブジェクトレベルの二重アテンション機構を用いて時間的・空間的コンテキストを統合することで特徴表現を向上させる、動画インスタンスセグメンテーションのための包括的特徴集約フレームワーク、CompFeatを提案する。さらに、交差相関マップを用いた相関ベースのトラッキングモジュールを導入し、インスタンスマッチングを改善し、YouTube-VISでSOTA性能を達成し、APスコア28.4%を記録した。

ABSTRACT

Video instance segmentation is a complex task in which we need to detect, segment, and track each object for any given video. Previous approaches only utilize single-frame features for the detection, segmentation, and tracking of objects and they suffer in the video scenario due to several distinct challenges such as motion blur and drastic appearance change. To eliminate ambiguities introduced by only using single-frame features, we propose a novel comprehensive feature aggregation approach (CompFeat) to refine features at both frame-level and object-level with temporal and spatial context information. The aggregation process is carefully designed with a new attention mechanism which significantly increases the discriminative power of the learned features. We further improve the tracking capability of our model through a siamese design by incorporating both feature similarities and spatial similarities. Experiments conducted on the YouTube-VIS dataset validate the effectiveness of proposed CompFeat. Our code will be available at https://github.com/SHI-Labs/CompFeat-for-Video-Instance-Segmentation.

研究の動機と目的

  • 動きぼけや外観変化の下で単一フレーム特徴の使用に起因する誤りを解消するための課題に取り組む。
  • フレームレベルおよびオブジェクトレベルでの時間的・空間的コンテキストの集約を通じて、特徴の識別性を向上させる。
  • 空間的配置と特徴類似度を組み込むことで、新規の相関ベースのトラッキングモジュールによりトラッキングのロバスト性を向上させる。
  • YouTube-VISベンチマーク上で各コンポonentの寄与を体系的に評価するためのアブレーションスタディを実施する。

提案手法

  • 時間的アテンションをフレーム間で、空間的アテンションをフレーム内に適用する二重アテンションモジュールを提案し、文脈的情報を用いて特徴を精緻化する。
  • 他のインスタンスの特徴に注目することで、二重アテンション機構をオブジェクトレベルに拡張し、インスタンス間の識別性を向上させる。
  • 参照オブジェクトと現在のフレーム間の交差相関マップを計算する相関ベースのトラッキングモジュールを導入し、空間に配慮したマッチングを可能にする。
  • オブジェクトペア間のディープワイズ相関を用いてマッチングスコアを生成することで、単純な特徴類似度を上回るトラッキング精度を向上させる。
  • 特徴類似度と空間的類似度の両方を活用するシアンズ型の設計を採用し、ロバストなトラッキングを実現する。
  • フレームレベルおよびオブジェクトレベルのアテンションと相関トラッキングモジュールを統合し、一貫性のあるエンドツーエンド学習可能なフレームワークを構築する。

実験結果

リサーチクエスチョン

  • RQ1時間的・空間的コンテキストを両方活用した包括的特徴集約が、単一フレームベースラインを上回る動画インスタンスセグメンテーション性能を実現できるか?
  • RQ2フレームレベルおよびオブジェクトレベルのアテンション機構は、特徴精緻化とインスタンス識別性にどのように寄与するか?
  • RQ3空間に配慮した交差相関マップを用いる相関ベースのトラッキングモジュールは、従来の類似度ベース手法に比べてインスタンストラッキングにどの程度向上をもたらすか?
  • RQ4アテンションモジュールと相関トラッカーの個別的および統合的寄与は、全体の性能向上にどの程度寄与しているか?
  • RQ5トレーニング時のサンプリング戦略は、時間的・空間的対応関係を学習する能力にどのように影響を与えるか?

主な発見

  • 提案されたCompFeatフレームワークは、YouTube-VISの検証セットで28.4%のAPを達成し、ベースラインのMask-Track-RCNNをAPで4.3%、AP0.5で4.8%上回った。
  • フレームレベルの二重アテンションを統合することで、APは25.8%から26.3%に向上し、時間的・空間的コンテキスト集約の利点が裏付けられた。
  • オブジェクトレベルの二重アテンションモジュールは、AP、AP0.5、AP0.75それぞれで3.4%、3.5%、4.0%の向上をもたらし、特徴の識別性向上が顕著に確認された。
  • 相関ベースのトラッキングモジュール単体でも、ベースライン比でAPが1%以上向上し、フレームレベルアテンションと組み合わせた際に最良の性能が達成された。
  • トレーニング時にランダムサンプリングを採用することで、均一サンプリングに比べて一般化性能が向上し、時間的変動に対するモデルのロバスト性が向上した。
  • 定性的な結果から、CompFeatは複数の類似オブジェクトを正確にトラッキングでき、中程度のオクルージョンに対しても対応可能であり、外観変化が激しくてもIDの一貫性を維持できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。