Skip to main content
QUICK REVIEW

[論文レビュー] Grounded Video Situation Recognition

Zeeshan Ali Khan, C. V. Jawahar|arXiv (Cornell University)|Oct 19, 2022
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本稿では、ビデオの動的状況認識を統合的に実現する新規フレームワークであるGrounded Video Situation Recognition (GVSR) を提案する。この手法は、三段階のTransformerモデルであるVideoWhispererを用いて、動画内での動詞・役割ペアの予測、テキスト的キャプションの生成、空間的・時間的局在化を同時に実行する。VidSituデータセットにおいて、CIDErスコアが52.3(対象ベースライン46.0)と22%向上し、トレーニング時にボクセルボックスアノテーションを一切使用しない弱教師付き局在化を実現した。

ABSTRACT

Dense video understanding requires answering several questions such as who is doing what to whom, with what, how, why, and where. Recently, Video Situation Recognition (VidSitu) is framed as a task for structured prediction of multiple events, their relationships, and actions and various verb-role pairs attached to descriptive entities. This task poses several challenges in identifying, disambiguating, and co-referencing entities across multiple verb-role pairs, but also faces some challenges of evaluation. In this work, we propose the addition of spatio-temporal grounding as an essential component of the structured prediction task in a weakly supervised setting, and present a novel three stage Transformer model, VideoWhisperer, that is empowered to make joint predictions. In stage one, we learn contextualised embeddings for video features in parallel with key objects that appear in the video clips to enable fine-grained spatio-temporal reasoning. The second stage sees verb-role queries attend and pool information from object embeddings, localising answers to questions posed about the action. The final stage generates these answers as captions to describe each verb-role pair present in the video. Our model operates on a group of events (clips) simultaneously and predicts verbs, verb-role pairs, their nouns, and their grounding on-the-fly. When evaluated on a grounding-augmented version of the VidSitu dataset, we observe a large improvement in entity captioning accuracy, as well as the ability to localize verb-roles without grounding annotations at training time.

研究の動機と目的

  • 行動認識、意味的役割ラベル付け、空間的・時間的局在化を統合したフレームワークにより、包括的なビデオ理解を実現すること。
  • 従来の手法が真値の動詞に依存するか、局在化が欠落しているという限界を克服するため、弱教師付き局在化モジュールを導入すること。
  • 複数のイベントにまたがるエンティティや役割の曖昧さを解消し、キャプション生成のバイアスを低減するために、統合的モデリングを実施すること。
  • トレーニング時に局在化アノテーションを一切必要としないエンドツーエンドの予測モデルを設計すること。

提案手法

  • 三段階のTransformerアーキテクチャ:(1) ビデオクリップとオブジェクト特徴を統合的に符号化し、文脈に応じた埋め込み表現を生成するビデオオブジェクトエンコーダ。
  • 第二段階におけるロールクエリアテンション機構:動詞・役割クエリを用いてオブジェクト特徴にアテンションを適用し、クロスアテンションにより関連する視覚的領域を局在化する。
  • 第三段階におけるキャプション生成ヘッド:アテンションを経た特徴を用いて、自由形式のテキスト記述を各ロール・エンティティペアに対して生成する。
  • ボクセルボックスアノテーションを一切使用しない弱教師付き学習により、モデル全体をエンドツーエンドで訓練する。局在化予測はトレーニング時にボクセルボックスを必要としない。
  • イベントレベルの表現とクリップ間の自己アテンションを活用し、グローバルな文脈理解と細粒度の推論を可能にする。
  • 統一されたアーキテクチャを用いて動詞分類、SRL、局在化を同時に最適化し、タスクを分離しつつも、タスク間の依存関係を維持する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時に局在化アノテーションを一切必要としない統合モデルが、動詞、意味的役割、キャプション、空間的・時間的局在化を同時に予測できるか。
  • RQ2動詞予測、SRL、局在化の統合的モデリングが、分離的または動詞に依存するアプローチと比較して、キャプション精度と局在化性能をどのように向上させるか。
  • RQ3弱教師付き学習と文脈に応じた特徴に依存する場合、複数のイベントにまたがる役割や共参照エンティティをどの程度正しく識別できるか。
  • RQ4局在化が、とりわけ長尾分布や曖昧な記述において、生成キャプションの質と多様性を向上させるか。

主な発見

  • 提案されたVideoWhispererモデルは、エンドツーエンドの「Pred, Pred」設定でCIDErスコア52.3を達成し、ベースラインの「GT, GT」設定(46.0)を22%上回った。
  • トレーニング時にボクセルボックスの監督信号を一切使用しないにもかかわらず、局在化予測のIoUが0.13に達し、効果的な弱教師付き局在化を実現した。
  • 真値の動詞を用いた場合(例:CIDEr 45.06 vs. 52.3)、性能が著しく低下した。これは、モデルの統合的学習がゴールデン動詞に依存するのを低減していることを示している。
  • 定性的な結果から、モデルは多様で意味的に正確なキャプション(例:'woman in white dress' ではなく 'woman wearing white')を生成し、複雑なシーンにおいてもエージェント、目的語、道具を正しく局在化していることが確認された。
  • 顔の表情に注目することで、視覚的でない役割(例:様態)に対しても正しく局在化できており、意味的役割に対する効果的なアテンション機構を有していることが示された。
  • 主な限界として、動詞や役割の予測精度の低さ、同じオブジェクトの複数インスタンスに対するアテンションの困難さ、長尾分布下でのキャプションの多様性の欠如が挙げられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。