Skip to main content
QUICK REVIEW

[論文レビュー] MOSE: A New Dataset for Video Object Segmentation in Complex Scenes

Henghui Ding, Chang Liu|arXiv (Cornell University)|Feb 3, 2023
Visual Attention and Saliency Detection被引用数 6
ひとこと要約

本論文は、36のカテゴリにまたがる5,200個のオブジェクトを含む2,149本の高解像度動画で構成される大規模な動画オブジェクトセグメンテーションデータセットMOSEを紹介する。複雑なシーン、重度の隠蔽、オブジェクトの消失・再出現、小型・目立たないオブジェクト、混雑した環境を特徴としている。標準ベンチマーク(DAVISなど)では最先端手法が90%を超えるJ&Fを達成するが、MOSEでは半教師あり設定下で性能がわずか59.4%J&Fに低下し、現実世界における耐性の欠如が顕在化する。

ABSTRACT

Video object segmentation (VOS) aims at segmenting a particular object throughout the entire video clip sequence. The state-of-the-art VOS methods have achieved excellent performance (e.g., 90+% J&F) on existing datasets. However, since the target objects in these existing datasets are usually relatively salient, dominant, and isolated, VOS under complex scenes has rarely been studied. To revisit VOS and make it more applicable in the real world, we collect a new VOS dataset called coMplex video Object SEgmentation (MOSE) to study the tracking and segmenting objects in complex environments. MOSE contains 2,149 video clips and 5,200 objects from 36 categories, with 431,725 high-quality object segmentation masks. The most notable feature of MOSE dataset is complex scenes with crowded and occluded objects. The target objects in the videos are commonly occluded by others and disappear in some frames. To analyze the proposed MOSE dataset, we benchmark 18 existing VOS methods under 4 different settings on the proposed MOSE dataset and conduct comprehensive comparisons. The experiments show that current VOS algorithms cannot well perceive objects in complex scenes. For example, under the semi-supervised VOS setting, the highest J&F by existing state-of-the-art VOS methods is only 59.4% on MOSE, much lower than their ~90% J&F performance on DAVIS. The results reveal that although excellent performance has been achieved on existing benchmarks, there are unresolved challenges under complex scenes and more efforts are desired to explore these challenges in the future. The proposed MOSE dataset has been released at https://henghuiding.github.io/MOSE.

研究の動機と目的

  • 既存の動画オブジェクトセグメンテーション(VOS)ベンチマークが、顕著で孤立した、遮蔽のないオブジェクトを主に含むことによる現実世界への適用性の欠如に対処する。
  • 重度の隠蔽、オブジェクトの消失・再識別、小型・目立たないターゲットを含む複雑で現実的なシナリオにおける現在のVOS手法の性能を調査する。
  • 大規模で多様性に富み、かつ挑戦的なベンチマークデータセットを提供することで、より耐性があり汎用性の高いVOSアルゴリズムの開発を促進する。
  • 長期間の動画セグメンテーション、群衆の中でのオブジェクトトラッキング、複雑なシーンにおける小型または目立たないオブジェクトの処理における主な課題を特定する。

提案手法

  • MOSEデータセットは、スポーツ、都市風景、自然環境など多様な現実世界の動画ソースから収集され、オブジェクトの外観、運動、遮蔽パターンに高い多様性を確保した。
  • 各動画クリップには、36のカテゴリにまたがる5,200個のオブジェクトの高品質でピクセル単位のセグメンテーションマスクが含まれており、合計431,725個のマスクが存在する。
  • 長時間の動画シーケンス(既存のベンチマークを上回る平均長さ)を含むことで、長期間のトラッキングとセグメンテーション評価を可能にした。
  • データセットは複雑な視覚的課題に重点を置いている:頻繁な隠蔽、オブジェクトの消失と再識別、小型ターゲット、外観が似たオブジェクトが密集する環境。
  • 18の既存の最先端VOS手法を再訓練・評価することで包括的なベンチマークを実施し、4つの設定(半教師あり(マスクおよびバウンディングボックス)、非教師あり(ゼロショット)、インタラクティブVOS)をカバーした。
  • 評価指標には、複雑なシーン条件下での性能低下を定量的に評価するためのJ&F(ジャッカードとFスコア)を用いた。

実験結果

リサーチクエスチョン

  • RQ1標準ベンチマークとは対照的に、重度の隠蔽とオブジェクトの消失・再出現を伴うデータセットでテストされた最先端VOS手法の性能は、どのように変化するか?
  • RQ2現在のVOSモデルは、混雑で複雑なシーンにおいて、小型・目立たない、または顕著でないオブジェクトをどれほど正しく追跡できないか?
  • RQ3長期間の動画シーケンスと持続的な隠蔽に直面した際、既存のVOS手法の主な失敗モードは何か?
  • RQ4オブジェクトが孤立しておらず、頻繁に遮蔽される現実世界のシナリオにおいて、既存のVOS手法は一般化できるか?

主な発見

  • XMem や DeAOT といった最先端VOS手法は DAVIS では90%を超えるJ&Fを達成するが、MOSE では半教師あり設定下でそれぞれ57.6%および59.4%J&Fに低下し、複雑なシーンにおける顕著な性能格差が示された。
  • 性能低下の主な要因は、消失後のオブジェクト再識別と、特に再出現時の外観変化を伴う重度の隠蔽の処理困難さに起因する。
  • 類似した外観のオブジェクトが一緒に動くため、密集した群衆におけるオブジェクトのトラッキングとセグメンテーションに、既存の手法が困難を抱える。
  • 小型で目立たないオブジェクトは頻繁に消失したり誤分類されたりするため、現在のモデルが低可視性ターゲットに対して感受性に欠けていることが明らかになった。
  • MOSEに含まれる長時間の動画シーケンスは、現在のVOSモデルにおける計算およびメモリ制限を露呈しており、長期間にわたり正確なオブジェクト特徴を維持できないことが多く見られた。
  • 結果として、現在のVOSアルゴリズムは現実世界の複雑さに対して耐性がなく、文脈的推論と長期記憶に焦点を当てた新しいアーキテクチャおよび学習パラダイムの開発が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。