Skip to main content
QUICK REVIEW

[論文レビュー] Support-Set Based Cross-Supervision for Video Grounding

Xinpeng Ding, Nannan Wang|arXiv (Cornell University)|Aug 24, 2021
Multimodal Machine Learning Applications参考文献 52被引用数 7
ひとこと要約

本論文は、共有特徴空間内で対照的およびキャプション生成の目的関数を共同で最適化することで、ビデオアライメントを向上させるサポートセットベースのクロスサブスクリプション(Sscs)モジュールを提案する。Sscsは、全動画からの視覚的キューを要約するサポートセットを活用することで、正例とバックグラウンドクリップ間の視覚的エンティティの相互排他性を軽減し、推論コストを追加せずにマルチモodal表現学習を顕著に向上させる。Charades-STAにおけるR1@0.5で、最先端モデルを最大6.35%向上させる。

ABSTRACT

Current approaches for video grounding propose kinds of complex architectures to capture the video-text relations, and have achieved impressive improvements. However, it is hard to learn the complicated multi-modal relations by only architecture designing in fact. In this paper, we introduce a novel Support-set Based Cross-Supervision (Sscs) module which can improve existing methods during training phase without extra inference cost. The proposed Sscs module contains two main components, i.e., discriminative contrastive objective and generative caption objective. The contrastive objective aims to learn effective representations by contrastive learning, while the caption objective can train a powerful video encoder supervised by texts. Due to the co-existence of some visual entities in both ground-truth and background intervals, i.e., mutual exclusion, naively contrastive learning is unsuitable to video grounding. We address the problem by boosting the cross-supervision with the support-set concept, which collects visual information from the whole video and eliminates the mutual exclusion of entities. Combined with the original objectives, Sscs can enhance the abilities of multi-modal relation modeling for existing approaches. We extensively evaluate Sscs on three challenging datasets, and show that our method can improve current state-of-the-art methods by large margins, especially 6.35% in terms of R1@0.5 on Charades-STA.

研究の動機と目的

  • 既存のビデオアライメントモデルが、アーキテクチャが複雑であるため、複雑な動画・テキスト関係を学習する能力に制限を受ける問題に対処すること。
  • 推論コストを追加せずに、トレーニング中にマルチモーダル表現学習を向上させること。
  • 対照的学習において、正例とバックグラウンドクリップ間で共有される視覚的エンティティが意図せず抑制されるという、相互排他問題を解消すること。
  • サポートセット集約に基づく新規なクロスサブスクリプションメカニズムを用いて、動画とテキスト間の相関モデリングを強化すること。
  • 最小限のアーキテクチャ変更で、複数のベンチマークデータセットにおいて提案されたSscsモジュールの有効性を実証すること。

提案手法

  • Sscsモジュールは、共有特徴空間内での意味的に関連する動画・テキストペアの埋め込みを引き寄せるために、infoNCE損失を用いた判別的対照的目的関数を導入する。
  • ビデオエンコーダーをテキスト記述で監視するために、生成的キャプション目的関数を組み込むことで、ビデオ表現の質を向上させる。
  • 全動画から構築されたサポートセットにより、グローバルな視覚的文脈を捉え、フォアグラウンドとバックグラウンドの区間間での視覚的エンティティの相互排他性を低減する。
  • サポートセットは、すべてのクリップにわたる視覚特徴を集約し、アライメントに不可欠な共有視覚キュー(例:人物、グラス)を保持可能にする。
  • Sscsモジュールはトレーニング中の補助ブランチとして実装され、推論速度やアーキテクチャに影響を与えない。
  • 本手法は、既存のビデオアライメントモデルと互換性があり、2D-TAN や LGI といった最先端のバックボーンに簡単に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1推論コストを増加させずに、クロスサブスクリプションモジュールがマルチモーダル関係学習を向上させられるか。
  • RQ2対照的学習において、正例とバックグラウンドクリップ間の視覚的エンティティの相互排他性をどのように軽減できるか。
  • RQ3視覚特徴のサポートセットベースの集約が、動画・テキスト表現学習の一般化性とロバスト性を向上させるか。
  • RQ4Sscsは、多様なデータセットにおいて、最先端のビデオアライメントモデルをどの程度向上させられるか。
  • RQ5Sscsはなぜ2D-TANに対してLGIよりも大きな向上を達成するのか。また、データセットの複雑さは性能向上にどのように影響するか。

主な発見

  • Sscsは、Charades-STAにおける2D-TANのR1@0.5を6.35%向上させ、評価されたすべての手法の中で最大の向上を記録した。
  • TACoSでは、2D-TANのR1@0.5が4.24%向上し、データセットをまたいで一貫した改善を示した。
  • ActivityNet-Captionsでは、R1@0.5が2.16%向上し、より複雑で多様なデータセットでは小さな向上が得られた。
  • 類似度行列の結果、Sscsは、同じサンプルに属さない動画・テキストペア間の意味的関係を、ベースラインやGTCとは異なり捉えている。
  • 定性的分析により、Sscsは、ベースラインが初期の動画セグメントを好むのに対し、より正確で短く、中央付近の時間区間を予測することが確認された。
  • アブレーションスタディにより、サポートセット機構が相互排他性の低減とクロスサブスクリプションの有効性向上に不可欠であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。