Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Transductive Inference for Few-Shot Video Object Segmentation

Mennatullah Siam, Konstantinos G. Derpanis|arXiv (Cornell University)|Mar 27, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文は、少数ショット動画オブジェクトセグメンテーションのための新しい時系列伝達推論(TTI)手法を提案し、全フレームにわたる動画レベルの制約を用いてグローバルな時系列一貫性を強制することで、少数ショットサポートセットにおける過適合を軽減し、時系列の整合性を向上させる。この手法はYouTube-VISで最先端手法よりも2.5%のmIoU向上を達成し、徹底的にアノテートされたMiniVSPWベンチマークを導入した。

ABSTRACT

Few-shot video object segmentation (FS-VOS) aims at segmenting video frames using a few labelled examples of classes not seen during initial training. In this paper, we present a simple but effective temporal transductive inference (TTI) approach that leverages temporal consistency in the unlabelled video frames during few-shot inference. Key to our approach is the use of both global and local temporal constraints. The objective of the global constraint is to learn consistent linear classifiers for novel classes across the image sequence, whereas the local constraint enforces the proportion of foreground/background regions in each frame to be coherent across a local temporal window. These constraints act as spatiotemporal regularizers during the transductive inference to increase temporal coherence and reduce overfitting on the few-shot support set. Empirically, our model outperforms state-of-the-art meta-learning approaches in terms of mean intersection over union on YouTube-VIS by 2.8%. In addition, we introduce improved benchmarks that are exhaustively labelled (i.e. all object occurrences are labelled, unlike the currently available), and present a more realistic evaluation paradigm that targets data distribution shift between training and testing sets. Our empirical results and in-depth analysis confirm the added benefits of the proposed spatiotemporal regularizers to improve temporal coherence and overcome certain overfitting scenarios.

研究の動機と目的

  • 少数ショット動画オブジェクトセグメンテーションの推論において、時系列正則化の欠如を是正すること。
  • エピソード学習を用いずに、少数ショットサポートセットにおける一般化性能を向上させ、過適合を低減すること。
  • 従来のデータセットの限界を克服するため、徹底的にアノテートされた動画マスクを備えた新規ベンチマークを導入すること。
  • グローバルな空間時系列正則化子とキーフレームの最適化を用いて、時系列の一貫性を向上させること。
  • 伝達推論の有効性が、単一画像設定を超えて動画セグメンテーションにおいても示せることを実証すること。

提案手法

  • 本手法は、未ラベルのクエリフレームにおける前景/背景領域の割合正則化を伴うフレームレベルの交差エントロピー損失を用いる。
  • グローバルな動画レベルの制約、$\mathbf{L}_{global}$ は、動画全体の動的更新された動画レベルのプロトタイプに合わせることで、全フレームにわたる一貫性のある線形分類器を強制する。
  • 最適化中に繰り返し更新される動画レベルのプロトタイプは、シーケンス全体のクラスを表す。
  • キーフレームの最適化は、グローバルプロトタイプに最も近いフレームを選択し、追加の分類器最適化を実施することで、良好にセグメンテーションされたフレームの精度を向上させる。
  • オンラインバックボーン微調整を回避することで、強力な性能を発揮する効率的な伝達推論が可能になる。
  • 本手法は、メタラーニングやエピソード学習を用いずに、サポートセットとクエリフレームのみを用いてエンドツーエンドに学習される。

実験結果

リサーチクエスチョン

  • RQ1グローバルな時系列制約は、少数ショット動画オブジェクトセグメンテーションにおける時系列の一貫性を向上させることができるか?
  • RQ2エピソード学習を用いない伝達推論は、FS-VOSにおいてメタラーニングベースの手法を上回る性能を示すか?
  • RQ3空間時系列正則化は、小さなサポートセットにおける過適合にどのように影響するか?
  • RQ4ベンチマークにおける徹底的なアノテーションは、評価の信頼性をどの程度向上させるか?
  • RQ5高価なバックボーン微調整を伴わず、キーフレームベースの最適化は分類器の品質を向上させることができるか?

主な発見

  • 提案されたTTI手法は、YouTube-VISで最先端手法よりも2.5%のmIoUの絶対的向上を達成した。
  • 特に、曖昧なオブジェクトやポーズが変化するオブジェクトに対して、少数ショットサポートセットにおける過適合が顕著に低減された。
  • 時系列の一貫性解析により、空間時系列正則化子がフレーム間での予測安定性を向上させていることが確認された。
  • VSPWデータセットから構築されたMiniVSPWベンチマークは、徹底的にラベル付けされたマスクを提供し、YouTube-VISにおける非徹底的アノテーションの問題を解決した。
  • 可視化結果から、TTIはサポートセットのオブジェクトがポーズや外観が変化する場合でも、時系列の一貫性を維持できており、RePRIベースラインを上回る性能を示した。
  • 一部のフレームでわずかな過分割が見られるものの、YouTube-VISの全フォールドにおいて、TTIは一貫してベースラインを上回り、劣化した解が少ない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。