Skip to main content
QUICK REVIEW

[論文レビュー] SiamMask: A Framework for Fast Online Object Tracking and Segmentation

Weiming Hu, Qiang Wang|arXiv (Cornell University)|Jul 5, 2022
Visual Attention and Saliency Detection被引用数 7
ひとこと要約

SiamMaskは、1つのバウンディングボックス初期化によって、視覚的オブジェクト追跡と動画オブジェクトセグメンテーションを同時に実行するリアルタイムなフレームワークを提案する。オフライン事前学習中に分類、バウンディングボックス回帰、およびバイナリセグメンテーションの3つのタスクを共同で学習することで、オンライン適応や高コストな後処理を必要とせず、55 FPSの推論速度と、追跡およびセグメンテーションベンチマークの両方で最先端の精度を達成した。

ABSTRACT

In this paper we introduce SiamMask, a framework to perform both visual object tracking and video object segmentation, in real-time, with the same simple method. We improve the offline training procedure of popular fully-convolutional Siamese approaches by augmenting their losses with a binary segmentation task. Once the offline training is completed, SiamMask only requires a single bounding box for initialization and can simultaneously carry out visual object tracking and segmentation at high frame-rates. Moreover, we show that it is possible to extend the framework to handle multiple object tracking and segmentation by simply re-using the multi-task model in a cascaded fashion. Experimental results show that our approach has high processing efficiency, at around 55 frames per second. It yields real-time state-of-the-art results on visual-object tracking benchmarks, while at the same time demonstrating competitive performance at a high speed for video object segmentation benchmarks.

研究の動機と目的

  • 1つのフレームワーク内で視覚的オブジェクト追跡と高精度な動画オブジェクトセグメンテーション(VOS)のギャップを埋める。
  • 従来、バウンディングボックスしか出力しない完全畳み込み型シアンズトラッカーの表現能力を、ピクセルレベルのセグメンテーションを組み込むことで向上させる。
  • 1つのシンプルな初期化で、リアルタイム性能(55 FPS)を維持しながら、追跡およびセグメンテーションベンチマークの両方で高い精度を達成する。
  • 1つのシーケンスごとの適応や微調整を必要とせず、段階的なモデル設計により複数オブジェクトの追跡およびセグメンテーションにフレームワークを拡張する。
  • トレーニング段階でセグメンテーションの監視情報を用いたエンドツーエンドのマルチタスク学習が、オンライン更新なしに強力なオンライン推論性能を実現できることを示す。

提案手法

  • 分類(オブジェクト局在化用)、バウンディングボックス回帰(RPNを介して)、およびクラスに依存しないバイナリセグメンテーション(ピクセルレベルのマスク予測用)の3本の並列ブランチを持つシアンズネットワークアーキテクチャを提案する。
  • YouTube-VOSなどの大規模データセットを用いたオフライン事前学習中に、分類、回帰、セグメンテーションの損失を統合した結合損失関数を用いて、モデルをエンドツーエンドで学習する。
  • テンプレート(最初のフレーム)とサーチ領域(現在のフレーム)の両方の特徴を共有バックボーンCNNで抽出し、各ブランチごとにタスク固有のヘッドを適用する。
  • 推論段階では、分類ブランチがオブジェクトの位置を決定する。セグメンテーションブランチが、スコアが最も高い領域の最終的なバイナリマスクを生成する。
  • 2つのSiamMaskモデルを段階的に接続することで、複数オブジェクトの追跡を可能にする。2番目のモデルは、最初のモデルのセグメンテーション出力から特定されたオブジェクトを追跡する。
  • オンライン適応を避けるために、オフラインでのマルチタスク事前学習に依存することで、1つのバウンディングボックス初期化でのリアルタイム推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1完全畳み込み型シアンズネットワークを、リアルタイム推論速度を維持したまま、正確なピクセルレベルのセグメンテーションマスクを出力できるように拡張できるか?
  • RQ2分類、回帰、セグメンテーションの3つのタスクを共同で学習することで、単一タスクのシアンズトラッカーと比較して、追跡およびセグメンテーションの性能が向上するか?
  • RQ31つのシンプルなバウンディングボックス初期化が、オンライン適応なしに、高精度な追跡と詳細なセグメンテーションを両立できるか?
  • RQ4提案されたマルチタスクフレームワークは、標準的な追跡およびセグメンテーションベンチマークで、どちらのタスクでも良好な性能を示すか?
  • RQ5微調整を必要とせず、最小限のアーキテクチャ変更で、複数オブジェクトの追跡およびセグメンテーションにフレームワークを拡張できるか?

主な発見

  • SiamMaskは、1つのコンsumerクラスGPUで55フレーム/秒の推論速度を達成し、これまで報告された中で最も高速なVOS手法となった。
  • VOT-2018ベンチマークでは、リアルタイム視覚的オブジェクト追跡の分野で新たな最先端性能を確立し、既存のリアルタイムトラッカーを精度面で上回った。
  • DAVIS-2016およびDAVIS-2017ベンチマークでは、スピードを考慮しても、動画オブジェクトセグメンテーションで競争力のある性能を示し、上位の手法の1つとなった。
  • 質的結果から、複雑な変形、運動ブラー、照明変化、背景のごみなどに対しても、良好な一般化性能を示した。
  • 2段階のバージョンでは、複数オブジェクトの追跡およびセグメンテーションが成功裏に実現され、段階的推論によるスケーラビリティが実証された。
  • 光学フロー、データオーグメンテーション、微調整を一切使用しないにもかかわらず、SiamMaskは強力な性能を発揮した。これは、最先端のVOS手法で一般的に必要な技術である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。