Skip to main content
QUICK REVIEW

[論文レビュー] Relation-aware Video Reading Comprehension for Temporal Language Grounding

Jialin Gao, Sun Xin|arXiv (Cornell University)|Oct 12, 2021
Multimodal Machine Learning Applications参考文献 41被引用数 5
ひとこと要約

本稿では、動画の読解理解として定式化することで、質問と動画の期間候補間の粗い・細かいクロスモodal相互作用を活用し、グラフ畳み込みネットワークを用いて選択肢間の関係をモデル化することにより、時系列言語基準化のための関係認識ネットワーク(RaNet)を提案する。RaNetは最先端の性能を達成し、TACoSにおいて前人最高手法よりも平均平均精度を33.54%向上させた。

ABSTRACT

Temporal language grounding in videos aims to localize the temporal span relevant to the given query sentence. Previous methods treat it either as a boundary regression task or a span extraction task. This paper will formulate temporal language grounding into video reading comprehension and propose a Relation-aware Network (RaNet) to address it. This framework aims to select a video moment choice from the predefined answer set with the aid of coarse-and-fine choice-query interaction and choice-choice relation construction. A choice-query interactor is proposed to match the visual and textual information simultaneously in sentence-moment and token-moment levels, leading to a coarse-and-fine cross-modal interaction. Moreover, a novel multi-choice relation constructor is introduced by leveraging graph convolution to capture the dependencies among video moment choices for the best choice selection. Extensive experiments on ActivityNet-Captions, TACoS, and Charades-STA demonstrate the effectiveness of our solution. Codes have been available.

研究の動機と目的

  • 視覚的に類似した動画期間候補を区別する課題に対処すること。
  • テキストと動画の期間の間のクロスモダリティ整合性を、細分化されたトークンレベルおよび文レベルの相互作用によって向上させること。
  • 複数の期間候補間の意味的・時間的依存関係をモデル化することで、候補のランク付けを向上させること。
  • 標準ベンチマークで既存手法を上回る効率的で軽量なアーキテクチャを開発すること。

提案手法

  • 動画(パassage)、質問(クエリ)、複数の選択肢(候補期間)を用いて、時系列言語基準化を動画の読解理解として定式化する。
  • 文-期間およびトークン-期間レベルでの粗い・細かいクロスモダリティ相互作用を実行する選択肢-クエリ相互作用器を導入する。
  • 選択肢の表現間の依存関係をモデル化するため、グラフ畳み込みネットワーク(GCN)に基づく複数選択肢関係構築器を採用する。
  • スパarsely接続されたグラフアテンションメカニズムを用いて、FLOPsを削減しつつ、グローバルな期間間関係を効率的に捉える。
  • より良いテキスト表現を得るため、事前学習済みの単語埋め込み(例:BERT)を活用し、初期特徴統合に連結を用いる。
  • 視覚的・言語的および関係的特徴を統合した上で、候補集合から最も一致する期間を選択するランカーを採用する。

実験結果

リサーチクエスチョン

  • RQ1文レベルおよびトークンレベルの相互作用をモデル化することで、時系列基準化における視覚的・言語的整合性が向上するか?
  • RQ2動画期間候補間の選択肢間関係を捉えることで、曖昧な状況下でのランク付け性能が向上するか?
  • RQ3時系列基準化を動画の読解理解として定式化することで、一般化性能および性能が向上するか?
  • RQ4畳み込みや自己アテンション機構と比較して、グラフベースの関係モデリングは、精度と効率の両面で優れているか?

主な発見

  • RaNetはTACoSデータセットでRank 1@0.5スコア33.54%を達成し、前回のSOTA手法2D-TANと比較して33.54%の向上を示した。
  • 本モデルは3つのベンチマーク(ActivityNet-Captions、TACoS、Charades-STA)で最先端手法を上回り、一貫した向上を示した。
  • BERT埋め込みを用いることで最高の性能(TACoSにおけるRank 1@0.1が57.34%)が得られ、文脈を反映したテキスト特徴の重要性を確認した。
  • 2D-TANと比較して、RaNetは顕著に効率的であり、ActivityNetではパラメータ数が12.8M、FLOPsが43.92Gと、それぞれ91.59Mおよび997.30Gに比べて大幅に削減された。
  • アブレーションスタディの結果、粗い・細かい相互作用モジュールおよび関係構築モジュールの両方が性能向上に不可欠であることが確認され、いずれかのモジュールを除去すると顕著な精度低下が生じた。
  • 定性的な結果から、RaNetの予測は、視覚的に類似した候補がある状況でも、ベースラインと比較して真値に近いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。