Skip to main content
QUICK REVIEW

[論文レビュー] Look at What I'm Doing: Self-Supervised Spatial Grounding of Narrations in Instructional Videos

Reuben Tan, Bryan A. Plummer|arXiv (Cornell University)|Oct 20, 2021
Multimodal Machine Learning Applications参考文献 56被引用数 13
ひとこと要約

本論文は、対照的学習を用いた多層クロスモーダルアテンションネットワークを用いて、自己教師あり手法により、説明付きの動画内インタラクションの空間的局所化を実現する手法を提案する。文脈間およびモダリティ内アテンションを交互に適用し、文レベルの対照的損失を最適化することで、画像におけるフレーズグランドイングで最先端の性能を達成し、YouCook2動画における局所化されたインタラクションのための新しいデータセットでもベースラインを上回る性能を示した。

ABSTRACT

We introduce the task of spatially localizing narrated interactions in videos. Key to our approach is the ability to learn to spatially localize interactions with self-supervision on a large corpus of videos with accompanying transcribed narrations. To achieve this goal, we propose a multilayer cross-modal attention network that enables effective optimization of a contrastive loss during training. We introduce a divided strategy that alternates between computing inter- and intra-modal attention across the visual and natural language modalities, which allows effective training via directly contrasting the two modalities' representations. We demonstrate the effectiveness of our approach by self-training on the HowTo100M instructional video dataset and evaluating on a newly collected dataset of localized described interactions in the YouCook2 dataset. We show that our approach outperforms alternative baselines, including shallow co-attention and full cross-modal attention. We also apply our approach to grounding phrases in images with weak supervision on Flickr30K and show that stacking multiple attention layers is effective and, when combined with a word-to-region loss, achieves state of the art on recall-at-one and pointing hand accuracies.

研究の動機と目的

  • 手動による空間的アノテーションが一切ない状態で、複雑で構成的な説明付きの動画内インタラクションの局所化を解決すること。
  • 自動的に音声認識された説明を備えた大規模な教育的動画を用いて、自己教師あり学習を可能にすること。
  • 構造化されたアテンション機構を用いて、自然言語文と時空間的動画領域の間のクロスモーダル整合性を向上させること。
  • 同じアーキテクチャを用いて、弱教師ありフレーズグランドイングタスクへの一般化を示すこと。
  • 説明付きのインタラクションに空間的アノテーションを備えた、新しい評価データセットを導入すること。

提案手法

  • 文脈間およびモダリティ内アテンションを交互に適用することで、クロスモーダル表現を精緻化する、対照的多層マルチモーダルアテンション(CoMMA)モジュールを提案する。
  • 文レベルの対照的損失を用いて、言語モダリティと視覚モダリティからの文の表現を整列させ、説明された行動と対応する動画領域のグローバルな整合性を促進する。
  • モジュール間のアテンションを交互に計算する分割型トレーニング戦略を採用し、一方のモダリティが支配的になるような自明な解を防ぐ。
  • 文全体の表現を集約し、動画クリップと対照する文レベルの損失を導入することで、長距離依存関係のモデリングを向上させる。
  • 単語から領域への一致損失と文レベルの対照的損失を組み合わせることで、弱教師ありフレーズグランドイングにモデルを適用する。
  • HowTo100Mで自己教師あり学習をエンドツーエンドで実行し、空間的アノテーションを備えた新しく収集したYouCook2ベースのデータセットで評価する。

実験結果

リサーチクエスチョン

  • RQ1人為的な空間的アノテーションが一切ない状態で、自己教師ありモデルが動画内の説明付きインタラクションを効果的に局所化できるか?
  • RQ2標準的な共通アテンションや完全なクロスアテンションと比較して、文脈間およびモダリティ内アテンションを交互に適用することで、クロスモーダル整合性が向上するか?
  • RQ3対照的学習を用いた多層アテンション機構は、動画内における複雑で構成的なフレーズのグランドイングにおいて、浅いアテンションモデルを上回る性能を示せるか?
  • RQ4モデルは弱教師ありフレーズグランドイングタスク(画像)に一般化できるか?また、文レベルの損失はこの設定でどのような役割を果たすか?
  • RQ5複数のアテンション層を積み重ねることで、動画内インタラクションのグランドイングおよび画像フレーズグランドイングの両タスクで性能が向上するか?

主な発見

  • 提案されたCoMMAモデルは、Flickr30Kにおける弱教師ありフレーズグランドイングのR@1およびポイント手の正確性で、先行研究を上回る最先端の性能を達成した。
  • 2番目のクロスアテンション層を追加することで、R@1は49.99%から53.80%に、ポイント手の再現率は74.97%から76.78%に向上し、より深いアテンションの有効性が示された。
  • 新しく作成したYouCook2ベースのデータセットにおいて、浅い共通アテンションおよび完全クロスアテンションのベースラインを上回った。
  • 文レベルの対照的損失は、複数の物体やアクティビティを含む複雑な動画内インタラクションにおいて、グローバルな整合性と性能を顕著に向上させた。
  • 画像フレーズグランドイングでは単語から領域への一致損失が重要であるが、動画内インタラクションのグランドイングではそれほど効果が薄く、モダリティ間整合性のニーズが異なることが示唆された。
  • 文レベルの損失で訓練した際、複数のアテンション層を積み重ねることで性能が向上した。これは、複雑なグランドイングタスクにおいて、より深いアーキテクチャが有益であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。