Skip to main content
QUICK REVIEW

[論文レビュー] Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge

Jiyang Qi, Yan Gao|arXiv (Cornell University)|Nov 15, 2021
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本論文では、901の遮蔽付き動画シーンにわたり296万個の高品質なマスクを含む大規模な動画インスタンスセグメンテーションデータセットOVISを紹介する。このデータセットは、動画理解における遮蔽推論のベンチマークと進化を目的として設計されたものである。最先端の手法でさえも、重度の遮蔽を受けるオブジェクトでは性能が著しく低下し(APが5.6に低下)、現在のモデルに顕著なギャップが存在することが示された。この問題を解決するために、ICCV 2021で開催されたコンテストが新たな手法の開発を促し、最良の結果として21.6のAPを達成した。

ABSTRACT

Although deep learning methods have achieved advanced video object recognition performance in recent years, perceiving heavily occluded objects in a video is still a very challenging task. To promote the development of occlusion understanding, we collect a large-scale dataset called OVIS for video instance segmentation in the occluded scenario. OVIS consists of 296k high-quality instance masks and 901 occluded scenes. While our human vision systems can perceive those occluded objects by contextual reasoning and association, our experiments suggest that current video understanding systems cannot. On the OVIS dataset, all baseline methods encounter a significant performance degradation of about 80% in the heavily occluded object group, which demonstrates that there is still a long way to go in understanding obscured objects and videos in a complex real-world scenario. To facilitate the research on new paradigms for video understanding systems, we launched a challenge based on the OVIS dataset. The submitted top-performing algorithms have achieved much higher performance than our baselines. In this paper, we will introduce the OVIS dataset and further dissect it by analyzing the results of baselines and submitted methods. The OVIS dataset and challenge information can be found at http://songbai.site/ovis .

研究の動機と目的

  • 重度の遮蔽を受けるオブジェクトを動画で認識するという、現在の動画理解システムが人間の視覚と比べて著しく性能を発揮できないという深刻な課題に対処すること。
  • 現実世界の複雑さと多様性をよりよく反映するため、遮蔽付き動画インスタンスセグメンテーションに特化した大規模かつ高品質なデータセットを構築すること。
  • 実世界の複雑なシーンにおける遮蔽が強い状況下での、現在の最先端の動画インスタンスセグメンテーションモデルの限界を、包括的なベースライン分析を通じて評価すること。
  • ICCV 2021で開催された「遮蔽付き動画インスタンスセグメンテーションコンテスト」を通じて、遮蔽推論のための新規なパラダイムの研究を促進すること。

提案手法

  • OVISデータセットは、多様な遮蔽タイプ(長時間のシーケンス、高密度のオブジェクトなど)を有する901の複雑な動画シーンを収集することで構築された。
  • 各フレーム内のすべてのインスタンスに対して、正確なインスタンスマスクと遮蔽度スコアがアノテーションされ、遮蔽の度合いに応じた細分化された評価が可能になった。
  • MaskTrack R-CNN、STEm-Seg、QueryInstなど、9つの最先端の動画インスタンスセグメンテーションモデルをOVIS上で評価し、ベースライン性能を確立した。
  • ICCV 2021コンテストでは、新規なアーキテクチャやトレーニング戦略の応募を呼びかけ、上位の手法は時間的モデリングとCOCO や Pascal VOC といった画像レベルデータセットからのデータ拡張を活用した。
  • データ拡張(例:COCOから合成された画像ペア)がモデルの遮蔽耐性に与える影響を分析するためのアブレーションスタディを実施した。
  • 標準的な指標(AP(平均精度)を含む)を用いて性能を評価し、特に重度の遮蔽を受けるオブジェクト(AP_HO)についても個別にスコアを算出した。

実験結果

リサーチクエスチョン

  • RQ1現在の最先端の動画インスタンスセグメンテーションモデルは、人間の視覚と比較して、重度の遮蔽を受けるオブジェクトに対してどの程度の性能を発揮するのか?
  • RQ2実世界の複雑なシーンにおいて、遮蔽が既存の動画インスタンスセグメンテーション手法の性能にどの程度悪影響を及えるのか?
  • RQ3どのようなアーキテクチャ的・トレーニング的イノベーションが、遮蔽付き動画インスタンスセグメンテーションの性能向上に寄与するのか?
  • RQ4画像レベルのインスタンスセグメンテーションデータセット(例:COCO や Pascal VOC)を用いたデータ拡張は、動画モデルの遮蔽耐性向上に効果を発揮するのか?
  • RQ5現在のモデルが遮蔽状況で示す主な失敗モードは何か?また、それらは文脈的関連性やオブジェクトの関連付けにおいて、人間の推論と比較してどの程度異なるのか?

主な発見

  • すべてのベースライン手法が、重度の遮蔽を受けるオブジェクトにおいて著しい性能低下を示し、このグループでの最高APはわずか5.6にとどまり、遮蔽推論における顕著なギャップが示された。
  • コンテストで最良の成績を収めた手法は、テストセットでAPが21.6を達成し、最良のベースライン(16.3 AP)を大きく上回った。これは遮蔽耐性の向上が図られたことを示している。
  • COCO や Pascal VOC から合成された画像ペアを用いたデータ拡張により、STEm-SegのAPが2.4ポイント向上(13.8から16.2に)した。これは、遮蔽一般化に向けたデータ拡張の有効性を示している。
  • 3D畳み込みやボトムアップアーキテクチャ(例:STEm-Seg)を採用した手法が、遮蔽状況下でより優れた性能を示した。これは、より優れた時間的モデリングと検出のボトルネック回避によるものと推定される。
  • 失敗事例の分析から、IDの入れ替え、完全に遮蔽されたオブジェクトの再識別不能、重なった密集したシーンでの混乱といった継続的な問題が明らかになった。
  • コンテストの結果から、最良の手法ですら、オブジェクトが小さく重なっている、または完全に隠されているような重度の遮蔽状況では依然として困難を抱えていることが明らかになった。これは、文脈的推論の向上が今後の鍵であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。