Skip to main content
QUICK REVIEW

[論文レビュー] HERO: HiErarchical spatio-tempoRal reasOning with Contrastive Action Correspondence for End-to-End Video Object Grounding

Mengze Li, Tianbao Wang|arXiv (Cornell University)|Aug 11, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

HEROは、行動一貫性フレーム検索のための弱教師付き対照学習とピラミッドおよびシフトされたアライメント機構を備えた階層的マルチヘッドアテンションを導入することで、不完全なクロスモodal対応性と空間的・時間的局所性への感受性の欠如という問題に取り組む、動画オブジェクトグランドイングのための新規エンドツーエンドフレームワークを提案する。2つのベンチマークデータセットにおいて最先端の性能を達成し、先行手法を顕著に上回る。

ABSTRACT

Video Object Grounding (VOG) is the problem of associating spatial object regions in the video to a descriptive natural language query. This is a challenging vision-language task that necessitates constructing the correct cross-modal correspondence and modeling the appropriate spatio-temporal context of the query video and caption, thereby localizing the specific objects accurately. In this paper, we tackle this task by a novel framework called HiErarchical spatio-tempoRal reasOning (HERO) with contrastive action correspondence. We study the VOG task at two aspects that prior works overlooked: (1) Contrastive Action Correspondence-aware Retrieval. Notice that the fine-grained video semantics (e.g., multiple actions) is not totally aligned with the annotated language query (e.g., single action), we first introduce the weakly-supervised contrastive learning that classifies the video as action-consistent and action-independent frames relying on the video-caption action semantic correspondence. Such a design can build the fine-grained cross-modal correspondence for more accurate subsequent VOG. (2) Hierarchical Spatio-temporal Modeling Improvement. While transformer-based VOG models present their potential in sequential modality (i.e., video and caption) modeling, existing evidence also indicates that the transformer suffers from the issue of the insensitive spatio-temporal locality. Motivated by that, we carefully design the hierarchical reasoning layers to decouple fully connected multi-head attention and remove the redundant interfering correlations. Furthermore, our proposed pyramid and shifted alignment mechanisms are effective to improve the cross-modal information utilization of neighborhood spatial regions and temporal frames. We conducted extensive experiments to show our HERO outperforms existing techniques by achieving significant improvement on two benchmark datasets.

研究の動機と目的

  • 動画コンテンツに単一のアクションを表すテキストクエリと完全に一致しない複数のアクションが含まれる場合に生じる、動画オブジェクトグランドイングにおける不完全なクロスモーダル意味的対応性を解消すること。
  • 動画モデリングにおけるトランスフォーマーの空間的・時間的局所性への感受性の欠如を克服することにより、微細な特徴アライメントを制限する要因を軽減すること。
  • 複数の粒度で空間的および時間的依存関係を明示的にモデル化することで、クロスモーダルアライメントと特徴表現を向上させること。
  • 構造的な階層的推論を用いて、検索とグランドイングの両方の精度を向上させる統合的でエンドツーエンドのフレームワークを開発すること。

提案手法

  • 動画-キャプションのアクション意味的対応性に基づいて、フレームをアクション一貫性あり/なしに分類する弱教師付き対照学習モジュールを導入する。
  • 完全結合アテンションを属性-空間、アクション-空間、およびアクション-時間アテンションヘッドに分離することで干渉を低減し、局所性感受性を向上させる階層的マルチヘッド自己アテンション機構を設計する。
  • 隣接する空間領域および時間フレーム間でクロスモーダル情報の利用を強化するためのピラミッドアライメント機構を採用する。
  • 位置をシフトさせたアテンションマップの再重み付けにより、空間的および時間的依存関係をよりよく捉えるためにシフトアライメント機構を組み込む。
  • これらのモジュールを統合し、アクション検索とオブジェクトグランドイングを同時に最適化するエンドツーエンドのモデルを構築する。
  • まずアクション一貫性フレームを特定し、次にオブジェクト局所化を精緻化する粗〜細の検索戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1動画の意味がテキストクエリよりも細分化されている状況において、弱教師付き対照学習は、クロスモーダルアライメントの向上にどのように寄与するか?
  • RQ2分離されたアテンションヘッドを備えた階層的アテンションは、トランスフォーマーにおける空間的・時間的局所性のモデリングにどの程度寄与するか?
  • RQ3ピラミッドおよびシフトアライメント機構は、空間的および時間的次元におけるクロスモーダル特徴の利用を向上させ得るか?
  • RQ4HEROフレームワークの個々のモジュールは、動画オブジェクトグランドイングにおける全体的な性能向上にどの程度寄与しているか?
  • RQ5提案された階層的推論フレームワークは、標準のベンチマークにおいて、標準的なトランスフォーマー基盤モデルを上回る性能を示すか?

主な発見

  • VidSTGデータセットでは63.8%の平均mAPを達成し、以前の最先端手法(63.1%)およびベースモデル(60.4%)を顕著に上回った。
  • MSVDデータセットでは64.5%のmAPを達成し、最高のベースライン(63.3%)を上回り、両ベンチマークで一貫した向上を示した。
  • アブレーションスタディの結果、粗〜細のアクション検索や階層的MSAモジュールなどの任意のモジュールを削除すると性能が顕著に低下し、それらの必要性が確認された。
  • すべてのモジュールを組み合わせた場合に最高の性能が得られ、対照学習、階層的アテンション、アライメント機構が相補的に貢献していることが示された。
  • 可視化結果から、特に複数のアクションを含む複雑なシーンにおいて、HEROはより正確なバウンディングボックスを予測し、正解とよりよく一致することが確認された。
  • 特に細分化されたアクションによって記述されるオブジェクトの局所化において、STVGBert(最高性能のベースライン)に比べて、より優れた表現学習能力と検出能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。