Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Temporal Adjacent Network for Language Grounding

Yuechen Wang, Jiajun Deng|arXiv (Cornell University)|Jun 30, 2021
Multimodal Machine Learning Applications参考文献 62被引用数 11
ひとこと要約

本稿では、複数のインスタンス学習(MIL)問題として定式化された、弱教師付き時系列言語基準化のための新規フレームワークである弱教師付き時系列隣接ネットワーク(WSTAN)を提案する。本手法は、個々のクエリではなく、完全な段落による記述を用いる。時系列隣接ネットワーク、疑似教師付きの補完的ブランチ、自己判別損失を活用することで、クロスモodalな整合性と時系列の正確性が向上し、時系列境界のアノテーションを一切必要とせず、3つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Temporal language grounding (TLG) is a fundamental and challenging problem for vision and language understanding. Existing methods mainly focus on fully supervised setting with temporal boundary labels for training, which, however, suffers expensive cost of annotation. In this work, we are dedicated to weakly supervised TLG, where multiple description sentences are given to an untrimmed video without temporal boundary labels. In this task, it is critical to learn a strong cross-modal semantic alignment between sentence semantics and visual content. To this end, we introduce a novel weakly supervised temporal adjacent network (WSTAN) for temporal language grounding. Specifically, WSTAN learns cross-modal semantic alignment by exploiting temporal adjacent network in a multiple instance learning (MIL) paradigm, with a whole description paragraph as input. Moreover, we integrate a complementary branch into the framework, which explicitly refines the predictions with pseudo supervision from the MIL stage. An additional self-discriminating loss is devised on both the MIL branch and the complementary branch, aiming to enhance semantic discrimination by self-supervising. Extensive experiments are conducted on three widely used benchmark datasets, \emph{i.e.}, ActivityNet-Captions, Charades-STA, and DiDeMo, and the results demonstrate the effectiveness of our approach.

研究の動機と目的

  • 完全教師ありの時系列言語基準化における高いアノテーションコストを低減するため、時系列境界ラベルが不要で、動画レベルの記述のみを用いた学習を可能にする。
  • 従来の手法が時系列の識別性に欠ける弱教師あり設定において、テキストと動画のコンテンツ間のクロスモダリティ的意味的整合性を向上させる。
  • 時系列の文脈をモデル化し、疑似教師付きの補完的ブランチを用いて予測を精錬することで、局所化の正確性を向上させる。
  • 粗い動画スクリプトを弱教師付きの情報として用いる可能性を検討し、最小限のアノテーションで実世界のデータに応用可能な範囲を拡大する。

提案手法

  • 弱教師あり時系列言語基準化を、候補となる動画セグメントをバッグとし、テキスト段落をインスタンスとして扱う複数インスタンス学習(MIL)問題として定式化する。
  • 均等に分割された動画クリップから2次元スコアマップを構築し、各要素がクリップ i から j までの候補時系列セグメントを表すようにすることで、時系列的関係のモデル化を可能にする。
  • MILフレームワーク内に時系列隣接ネットワークを導入し、動画セグメント間の順序的依存関係を活用し、段落レベルのテキスト入力との整合性を向上させる。
  • 中間結果から生成された疑似ラベルを用いてMILブランチからの予測を精錬する補完的ブランチを導入し、意味的スパarsityを低減する。
  • MILブランチおよび補完的ブランチの両方に自己判別損失を適用し、意味的に豊かな動画セグメントに注目することで、時系列の識別性を向上させる。
  • 訓練中の監督信号の不確実性を低減するため、疑似ラベルの閾値を設定(o_max=1.0, o_min=0.9)する。

実験結果

リサーチクエスチョン

  • RQ1単一クエリ入力と比較して、段落レベルのテキスト入力は、弱教師あり時系列言語基準化におけるクロスモダリティ的整合性と局所化性能を向上させるか?
  • RQ2補完的ブランチは、MILの予測をどれほど効果的に精錬し、初期マッチングでは明確でないが意味的に重要なクリップを特定できるか?
  • RQ3自己判別損失は、小型の物体やポーズといったキーメンタルコンテンツに注目することで、どの程度時系列の正確性を向上させるか?
  • RQ4WSTANは、構文が複雑な動画レベルのスクリプトを弱教師付き情報として用いる場合でも、顕著な性能低下なしに一般化可能か?

主な発見

  • WSTANは、時系列境界アノテーションを一切必要とせず、3つのベンチマークデータセット(Charades-STA、ActivityNet-Captions、DiDeMo)で最先端の性能を達成する。
  • 段落入力の設計により、大多数の指標で性能が向上し、動画間の意味的部分的類似性に起因するノイズが低減されることを示している。
  • 補完的ブランチは局所化の正確性を顕著に向上させ、定性的な結果から、WSTANの完全モデルがベースモデルが見逃すような微細な意味的コンセプト(例:'off')を検出できていることが示されている。
  • 自己判別損失はモデルの識別性を向上させ、特にR@1の性能向上に寄与している。一方、補完的ブランチの疑似ラベル閾値は主にR@5に影響を与える。
  • WSTANは動画スクリプトを弱教師付き情報として用いる場合にも良好に一般化され、標準的な記述入力と同等の性能を達成しており、低リソース環境におけるロバスト性が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。