Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Sentence Temporal and Semantic Relations in Video Activity Localisation

Jiabo Huang, Yang Liu|arXiv (Cornell University)|Jul 23, 2021
Multimodal Machine Learning Applications参考文献 36被引用数 9
ひとこと要約

本稿では、動画アクティビティ局所化の弱教師あり手法として、クロスセンテンス関係マイニング(CRM)を提案する。CRMは、文間の時系列的順序と意味的一致性の制約を活用することで、モーメントグランドイングの精度を向上させる。段落レベルの関係(例えば、アクティビティの順序や文間の意味的整合性)をモデル化することで、動画とテキストのアライメントにおける曖昧さを低減し、特に複雑な記述において最先端の性能を達成した。

ABSTRACT

Video activity localisation has recently attained increasing attention due to its practical values in automatically localising the most salient visual segments corresponding to their language descriptions (sentences) from untrimmed and unstructured videos. For supervised model training, a temporal annotation of both the start and end time index of each video segment for a sentence (a video moment) must be given. This is not only very expensive but also sensitive to ambiguity and subjective annotation bias, a much harder task than image labelling. In this work, we develop a more accurate weakly-supervised solution by introducing Cross-Sentence Relations Mining (CRM) in video moment proposal generation and matching when only a paragraph description of activities without per-sentence temporal annotation is available. Specifically, we explore two cross-sentence relational constraints: (1) Temporal ordering and (2) semantic consistency among sentences in a paragraph description of video activities. Existing weakly-supervised techniques only consider within-sentence video segment correlations in training without considering cross-sentence paragraph context. This can mislead due to ambiguous expressions of individual sentences with visually indiscriminate video moment proposals in isolation. Experiments on two publicly available activity localisation datasets show the advantages of our approach over the state-of-the-art weakly supervised methods, especially so when the video activity descriptions become more complex.

研究の動機と目的

  • 各文を個別に扱う弱教師あり動画アクティビティ局所化の限界を解消し、曖昧で不正確なモーメント提案を回避すること。
  • 文ごとの時系列境界を避けることで、アノテーションのバイアスとコストを低減しながらも、局所化の精度を向上させること。
  • 段落記述内に内在するクロスセンテンス関係(時系列的順序と意味的一致性)をトレーニング中の指導信号として活用すること。
  • 複数の文にわたる文脈的情報を活用することで、複雑または曖昧なクエリの局所化におけるモデルのロバスト性を向上させること。
  • 特に意味的に曖昧な記述や代名詞を含む記述の状況において、既存の弱教師あり手法を上回ること。

提案手法

  • 段落内の文の順序と一致する時系列的整合性制約を導入し、モーメント提案が同じ時系列的順序に従うように制約する。
  • ペアド文記述を連結クエリとして扱い、意味的一致性制約を適用することで、モデルが2つの正例モーメントの和集合と高いIoUを示す動画セグメントを選択することを保証する。
  • 自己注意およびクロス注意メカニズムを備えたマルチモodalネットワーク(MMN)バックボーンを用いて、動画特徴とテキスト埋め込み間の相互作用をモデル化する。
  • 対照的学習戦略を採用し、文間の関係的信号を用いて正しいモーメント提案と誤った提案を区別するようにモデルを学習させる。
  • 対照的損失と2つの関係的制約(時系列的および意味的一致性)を組み合わせて、エンドツーエンドでモデルを訓練し、提案選択をガイドする。
  • アテンションユニットを活用して長距離依存関係を捉え、視覚的・テキスト的アライメントを向上させる。アンブレーションスタディにより、過学習を避けるために中程度の深さが最適であることが示された。

実験結果

リサーチクエスチョン

  • RQ1段落記述内のクロスセンテンス時系列的順序は、弱教師あり設定下での動画モーメント局所化の精度を向上させることができるか?
  • RQ2ペアド文における意味的一致性を強制することで、複雑または代名詞ベースの記述の曖昧さは低減するか?
  • RQ3クロスセンテンス関係的制約は、文単位のモデル化と比較して、複雑な動画記述における局所化性能にどのように寄与するか?
  • RQ4アテンション機構は、動画・テキストアライメントにおけるクロスセンテンス文脈をどれほど効果的に捉えられるか?
  • RQ5段落レベルの記述からの関係的信号は、高コストな文単位の時系列アノテーションに代わる可能性があるか?

主な発見

  • CRMは、ActivityNet-CaptionsおよびCharadesの両データセットで最先端の性能を達成し、ActivityNet-CaptionsではIoU=0.5におけるリCALLが68.14%に達し、先行する弱教師あり手法を顕著に上回った。
  • 複雑な記述では10%以上のリCALL向上を達成し、クエリが曖昧または文脈依存的である場合にクロスセンテンス関係が特に有益であることが示された。
  • 実験から、SOTAベースラインが予測する65%のモーメントペアが誤った時系列的順序であることが判明し、明示的な時系列的整合性モデリングの必要性が浮き彫りになった。
  • 意味的一致性の実験では、ActivityNet-Captionsの38%の記述に曖昧な参照(例:代名詞)が含まれており、CRMはクロスセンテンス文脈を活用することでこれを効果的に解消した。
  • アンブレーションスタディにより、時系列的および意味的一致性制約の両方が不可欠であることが確認された。両方の制約を削除すると性能が著しく低下し、特に複雑な状況では意味的一致性制約が最大の向上をもたらした。
  • アテンション機構の使用は性能向上に寄与したが、層を多層にしすぎると限られた訓練データで過学習が生じ、結果が劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。