Skip to main content
QUICK REVIEW

[論文レビュー] OpenVIS: Open-vocabulary Video Instance Segmentation

Pinxue Guo, Tony Jun Huang|arXiv (Cornell University)|May 26, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

この論文では、訓練データに含まれないカテゴリであっても、テキストプロンプトを用いて任意のオブジェクトのゼロショット検出、セグメンテーション、トラッキングを可能にする、オープンボキャブラリー・ビデオインスタンスセグメンテーションの新規タスクOpenVISを紹介する。CLIPなどの事前学習済みビジョン・ランゲージモデルと互換性を高めるために、二段階フレームワークを提案し、マスクプロポーザルネットワークをバイナリ損失で訓練し、SquareCropという後処理戦略を採用することで、BURSTデータセットにおいてフルスーパvisedベースライン比で148%の向上を達成した。

ABSTRACT

Open-vocabulary Video Instance Segmentation (OpenVIS) can simultaneously detect, segment, and track arbitrary object categories in a video, without being constrained to categories seen during training. In this work, we propose InstFormer, a carefully designed framework for the OpenVIS task that achieves powerful open-vocabulary capabilities through lightweight fine-tuning with limited-category data. InstFormer begins with the open-world mask proposal network, encouraged to propose all potential instance class-agnostic masks by the contrastive instance margin loss. Next, we introduce InstCLIP, adapted from pre-trained CLIP with Instance Guidance Attention, which encodes open-vocabulary instance tokens efficiently. These instance tokens not only enable open-vocabulary classification but also offer strong universal tracking capabilities. Furthermore, to prevent the tracking module from being constrained by the training data with limited categories, we propose the universal rollout association, which transforms the tracking problem into predicting the next frame's instance tracking token. The experimental results demonstrate the proposed InstFormer achieve state-of-the-art capabilities on a comprehensive OpenVIS evaluation benchmark, while also achieves competitive performance in fully supervised VIS task.

研究の動機と目的

  • 訓練データに含まれる固定された閉じたカテゴリのセットに限定された既存のビデオインスタンスセグメンテーションモデルの限界を解消すること。
  • トレーニング中に確認されていなかったカテゴリのオブジェクトであっても、テキストプロンプトによってゼロショットでセグメンテーションを可能にすること。
  • ゼロショット一般化能力を測定できるように、既存のデータセットを用いてオープンボキャブラリー・ビデオインスタンスセグメンテーションの堅牢な評価ベンチマークを開発すること。
  • マスクされたオブジェクトプロポーザルとCLIPのような事前学習済みビジョン・ランゲージモデル(VLM)との互換性を向上させること。CLIPは入力の歪みやアスペクト比に敏感であるため。
  • オープンボキャブラリー性能を最大化するために、異なるバックボーンアーキテクチャとトレーニングデータ制約(特にカテゴリラベルなしのマスクアノテーション)の有効性を調査すること。

提案手法

  • 分類ヘッドを、カテゴリに依存しないすべての潜在的オブジェクトのプロポーザルを促進するように、バイナリクロスエントロピー損失で訓練されたインスタンスヘッドに置き換える。
  • マスクプロポーザルを正方形のアスペクト比にクランプしながらオブジェクトの内容を保持し、歪みを最小限に抑える、新しいSquareCrop後処理戦略を適用する。これにより、CLIPとの互換性が向上する。
  • 事前学習済みビジョン・ランゲージモデル(CLIP)を用いて、各プロポーザルと候補テキスト記述との間の視覚的・言語的類似度を計算し、最も類似度の高いカテゴリに割り当てる。
  • COCOとYouTube-VISデータセットの組み合わせを、カテゴリラベルなしのマスクアノテーション(C+Y’)でトレーニングすることで、未学習カテゴリへの一般化を可能にする。
  • マスクプロポーザル上で対照学習の目的関数を用いてCLIPの視覚エンコーダーを微調整し、視覚表現を下流のセグメンテーションタスクにさらに適合させる。
  • COCOとUVOデータセットの組み合わせ(C+U’)を用いて、より多くのマスクアノテーションを活用した追加の事前学習を行い、希少・未学習カテゴリのマスクプロポーザル品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1カテゴリラベルなしに、テキストプロンプトのみを用いて、ゼロショットでオープンボキャブラリー認識を効果的に行えるビデオインスタンスセグメンテーションモデルを拡張できるか?
  • RQ2マスクプロポーザルネットワークをどのように最適化すれば、トレーニングカテゴリセット外のオブジェクトであっても、高品質なクラスに依存しないマスクを生成できるか?
  • RQ3事前学習済みVLM(例:CLIP)を用いる場合、マスクプロポーザルの後処理戦略として、どの方法がゼロショット分類精度を最大限に高めるか?
  • RQ4バックボーンアーキテクチャの選択と、特にマスクアノテーションのみのデータ(カテゴリラベルなし)を用いたトレーニングデータ制約が、オープンボキャブラリー・ビデオインスタンスセグメンテーションの性能に与える影響は何か?
  • RQ5提案フレームワークは、COCOデータセットに存在しない希少・未学習カテゴリに対しても、どの程度一般化可能か?

主な発見

  • 提案されたOpenVISフレームワークは、BURSTデータセットにおいてフルスーパvisedベースライン比で平均平均精度(AP)が148%向上し、強力なゼロショット一般化能力を示した。
  • SquareCrop後処理戦略は、直接マスク入力と比較して21%(絶対値)、バウンディングボックスのリサイズ入力と比較して23%のCLIPベース分類精度向上を達成した(BURST検証セット)。
  • Swin-LバックボーンとViT-B CLIPエンコーダーを組み合わせ、UVOデータセット(C+U’)でトレーニングした場合、BURSTでのAPは4.97に達し、より大きなモデルとデータでスケーラビリティが強いことが示された。
  • COCOに含まれない希少カテゴリ404種類において、Swin-Lバックボーンを用いた場合、APは4.15を達成し、希少・未学習カテゴリでも優れた性能を示した。
  • ViT-BをCLIP視覚エンコーダーとして用いた場合APは3.48、ResNet-50を用いた場合APは2.56を記録し、異なるバックボーン構成においても一貫した向上が確認された。
  • アブレーションスタディにより、マスクプロポーザルネットワークにおけるバイナリ損失が、特に希少カテゴリのマスクカバレッジと検出精度を顕著に向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。