Skip to main content
QUICK REVIEW

[論文レビュー] PointTrack++ for Effective Online Multi-Object Tracking and Segmentation

Zhenbo Xu, Wei Zhang|arXiv (Cornell University)|Jul 3, 2020
Video Surveillance and Tracking Methods参考文献 10被引用数 4
ひとこと要約

PointTrack++ は、意味セグメンテーションヘッド、コピーアンドペーストデータオーグメンテーション、マルチステージトレーニングを用いて、インスタンスセグメンテーションの品質とエンベッディングの識別性を向上させる、オンラインマルチオブジェクトトラッキングおよびインスタンスセグメンテーション(MOTS)の改善されたフレームワークを提案する。この手法は、KITTI MOTSランクイングおよび5番目の BMTT MOTS チャレンジで最先端の性能を達成し、自動車では 86.81% の sMOTSA と 95.95% の MOTSA、歩行者では 65.51% の sMOTSA と 81.54% の MOTSA を達成した。

ABSTRACT

Multiple-object tracking and segmentation (MOTS) is a novel computer vision task that aims to jointly perform multiple object tracking (MOT) and instance segmentation. In this work, we present PointTrack++, an effective on-line framework for MOTS, which remarkably extends our recently proposed PointTrack framework. To begin with, PointTrack adopts an efficient one-stage framework for instance segmentation, and learns instance embeddings by converting compact image representations to un-ordered 2D point cloud. Compared with PointTrack, our proposed PointTrack++ offers three major improvements. Firstly, in the instance segmentation stage, we adopt a semantic segmentation decoder trained with focal loss to improve the instance selection quality. Secondly, to further boost the segmentation performance, we propose a data augmentation strategy by copy-and-paste instances into training images. Finally, we introduce a better training strategy in the instance association stage to improve the distinguishability of learned instance embeddings. The resulting framework achieves the state-of-the-art performance on the 5th BMTT MOTChallenge.

研究の動機と目的

  • 境界ボックスが重なって重複するシーンにおいて、判別性の高いインスタンスエンベッディングを学習する課題に対処する。
  • シードマップ予測を意味セグメンテーションヘッドに置き換えることで、MOTSにおけるインスタンスセグメンテーションの品質を向上させる。
  • 混雑したシーンにおけるデータオーグメンテーション戦略としてコピーアンドペースト法を用いることで、トレーニングの一般化性能とセグメンテーションのロバスト性を向上させる。
  • フォアグラウンドとバックグラウンドのエンベッディング学習を分離するマルチステージトレーニング戦略により、エンベッディングの識別性を高める。
  • オンラインでエンドツーエンドのフレームワークとして、KITTI MOTS および BMTT MOTS チャレンジベンチマークで最先端の性能を達成する。

提案手法

  • PointTrack のシードマップブランチを、ファクタル損失で訓練する意味セグメンテーションデコーダーに置き換えることで、インスタンス選択の品質を向上させる。
  • 類似した明度を持つインスタンスをトレーニング画像にペーストするコピーアンドペーストデータオーグメンテーション戦略を導入し、混雑したシーンをシミュレートする。
  • エンベッディングネットワークのためのマルチステージトレーニング戦略を実装し、第1段階ではフォアグラウンドエンベッディングに、第2段階では位置と環境エンベッディングに焦点を当てる。
  • ポイントクラウドベースのエンベッディングネットワークを用い、原始的な画像ピクセルを順序なしの2次元ポイントとして処理し、MLPを用いて位置、色、カテゴリの特徴を統合して文脈に適したインスタンスエンベッディングを学習する。
  • セグメンテーションとエンベッディングの段階を分離することで、トレーニング中に画像レベルおよび動画レベルのアノテーションを柔軟に利用できるようにする。
  • 入力画像を元のサイズの2倍にアップサンプリングすることで、特徴の解像度とセグメンテーションの正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1シードマップ予測を意味セグメンテーションヘッドに置き換えることで、MOTSにおけるインスタンス選択とセグメンテーションの品質が向上するか?
  • RQ2コピーアンドペーストデータオーグメンテーションは、混雑したシーンにおけるインスタンスセグメンテーションの一般化性能を向上させるのにどの程度有効か?
  • RQ3インスタンスエンベッディングのためのマルチステージトレーニング戦略は、より優れた識別性とトラッキング性能をもたらすか?
  • RQ4プロポーザルフリーなポイントクラウドベースのエンベッディングネットワークは、ROIベースの手法と比較して、MOTSで優れたトラッキング性能を達成できるか?
  • RQ5提案された改善策は、KITTI MOTS や BMTT MOTS のような困難なベンチマークで、どの程度性能を向上させるか?

主な発見

  • PointTrack++ は、自動車について KITTI MOTS テストセットで 86.81% の sMOTSA と 95.95% の MOTSA を達成し、PointTrack よりも 4.3% の向上を示した。
  • 歩行者について、PointTrack++ は KITTI テストセットで 65.51% の sMOTSA と 81.54% の MOTSA を達成し、PointTrack よりも 6.6% の向上を示した。
  • アブレーションスタディの結果、意味セグメンテーションヘッド、コピーアンドペーストオーグメンテーション、マルチステージトレーニングの組み合わせが最も高い性能向上をもたらした。
  • 意味セグメンテーションヘッド単体でも、歩行者の sMOTSA が 2.15% 向上し、誤検出および誤検出の削減に有効であることが確認された。
  • コピーアンドペーストオーグメンテーションは、歩行者について sMOTSA に 0.52% の向上をもたらし、混雑したシナリオにおけるロバスト性の向上を示している。
  • マルチステージトレーニング戦略は、シングルステージトレーニングと比較して MOTSA を 0.86% 向上させ、エンベッディングの識別性の向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。