Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Temporal Grounding with Structured Variational Cross-Graph Correspondence Learning

Juncheng Li, Junlin Xie|arXiv (Cornell University)|Mar 24, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本論文は、構成的時刻接地のための変分的クロスグラフ推論フレームワークVISAを提案する。動画と言語を階層的意味グラフ(全体的な出来事、局所的行動、原子的対象)でモデル化することで、微細な構造的クロスモーダル対応を可能にする。この手法は、特に新しい語の組み合わせに対して顕著な一般化性能の向上を達成し、Charades-CGではSOTAモデルを最大33.97% R@1上回り、ActivityNet-CGでは31.89%上回る。

ABSTRACT

Temporal grounding in videos aims to localize one target video segment that semantically corresponds to a given query sentence. Thanks to the semantic diversity of natural language descriptions, temporal grounding allows activity grounding beyond pre-defined classes and has received increasing attention in recent years. The semantic diversity is rooted in the principle of compositionality in linguistics, where novel semantics can be systematically described by combining known words in novel ways (compositional generalization). However, current temporal grounding datasets do not specifically test for the compositional generalizability. To systematically measure the compositional generalizability of temporal grounding models, we introduce a new Compositional Temporal Grounding task and construct two new dataset splits, i.e., Charades-CG and ActivityNet-CG. Evaluating the state-of-the-art methods on our new dataset splits, we empirically find that they fail to generalize to queries with novel combinations of seen words. To tackle this challenge, we propose a variational cross-graph reasoning framework that explicitly decomposes video and language into multiple structured hierarchies and learns fine-grained semantic correspondence among them. Experiments illustrate the superior compositional generalizability of our approach. The repository of this work is at https://github.com/YYJMJC/ Compositional-Temporal-Grounding.

研究の動機と目的

  • 現在のデータセットがトレーニングとテストの分割で重複する構成を含むため、時刻接地モデルにおける構成的一般化性を体系的に評価すること。
  • 標準ベンチマークで優れた性能を示すにもかかわらず、既存の最先端モデルが、見たことのある語の新しい組み合わせに一般化できないという問題を特定すること。
  • 既存手法が構造的でないグローバル表現に依存し、言語的および視覚的構成性を捉えられていないという、構造的意味モデリングの欠如に対処すること。
  • 動画と言語の両方における階層的意味を明示的にモデリングし、共同の構成的推論のための微細なグラフ間対応を学習するフレームワークを開発すること。
  • 時刻接地における構成的一般化の厳密な評価を可能にするため、2つの新しいベンチマーク分割、Charades-CG および ActivityNet-CG を構築すること。

提案手法

  • 動画と言語を3つの構造的レベル(全体的な出来事、局所的行動、原子的対象)に分解する階層的意味グラフを提案し、意味の構造的表現を可能にする。
  • グラフ内のノード間の微細な意味的対応を学ぶための構造的クロスモーダルアテンション機構を設計し、構成的推論を促進する。
  • 確率的かつ微分可能な対応を構造的ノード間でモデリングする変分的クロスグラフ対応(VCC)モジュールを導入し、不確実性を考慮したアライメントを可能にする。
  • 微細な意味的差を区別する能力を強化するため、構造的対照学習(SCL)目的関数を提案し、特に複雑または新しい構成において有効に働く。
  • 対照学習とクロスアテンション機構の組み合わせを用いて、エンドツーエンドでVISAフレームワークを訓練し、時刻接地と構成的アライメントの両方を最適化する。
  • 閾値ベースの可視化手法を用いて、学習されたグラフ構造を解釈し、言語的語と視覚的セグメント間の主要な意味的対応を強調する。

実験結果

リサーチクエスチョン

  • RQ1最先端の時刻接地モデルは、見たことのある語の新しい組み合わせにどの程度一般化できるか。また、それらの性能は、既に見た構成での性能と比べてどうなるか。
  • RQ2既存のモデルは、クエリ文における語順の変更に対してどの程度感受的か。これは、構成的意味ではなく表面的な相関に依存している可能性を示唆するか。
  • RQ3動画と言語の意味を階層的グラフで構造的にモデリングすることは、時刻接地における構成的一般化性の向上に寄与するか。
  • RQ4構造的対照学習(SCL)と変分的クロスグラフ対応(VCC)の貢献は、モデルが新しい構成を処理する能力にどの程度寄与しているか。
  • RQ5トレーニング時に見られなかった複雑または新しい言語的構成を含むクエリの場合、モデルは時刻的に接地されたセグメントをどの程度正確に局所化できるか。

主な発見

  • 最先端モデルは構成的一般化において深刻な失敗を示し、Charades-CGでは、既に見た構成でのR@1が24.14%であるのに対し、新しい構成では33.97%に低下する。これは、未観測の語の組み合わせへの一般化が不十分であることを示している。
  • SOTAモデルは語順の変更に対して極めて感受性が低い。シャッフルされたクエリでも元のクエリとほぼ同じ性能を示し、IoUスコアはほとんど変化しない。これは、表面的な相関に依存している可能性を示唆する。
  • 提案されたVISAフレームワークは、Charades-CG および ActivityNet-CG 両方でSOTA性能を達成し、それぞれ新しい構成スプリットでR@1が29.80%および27.60%を記録し、ベースラインを顕著に上回る。
  • アブレーションスタディの結果、SCLまたはVCCを削除すると性能が著しく低下する(例:Charades-CGで24.31% → 19.64%)。これは、両者とも微細な意味をモデリングする上で極めて重要な役割を果たしていることを確認する。
  • 定性的分析により、VISAは構成的意味に基づいて正しくセグメントを局所化している(例:'prepares to jump' と 'jump' の区別)。一方、ベースラインは、時系列的または意味的構造を誤解し失敗する。
  • 学習されたグラフの可視化により、VISAが 'perform kickboxing' といった言語的用語を、'punching person' や 'boxing ring' といった対応する視覚的要素と正しくアライメントしていることが確認され、効果的なクロスモーダル対応が実現していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。