Skip to main content
QUICK REVIEW

[論文レビュー] What and When to Look?: Temporal Span Proposal Network for Video Visual Relation Detection.

Sangmin Woo, Junhyug Noh|arXiv (Cornell University)|Jul 15, 2021
Multimodal Machine Learning Applications参考文献 22被引用数 4
ひとこと要約

本稿では、動画の視覚的関係検出のための新規手法である時系列スパン提案ネットワーク(TSPN)を提案する。TSPNは、関係の検索空間を疎にすることで、関係の存在する対象ペアとその発生時刻を同時に特定する。全動画の文脈を活用して時系列スパンとカテゴリの予測を実現する。TSPNはImageNet-VidVDRおよびVidORベンチマークで最先端の性能を達成しており、先行するセグメントベース手法と比較して2倍の効率性を示す。

ABSTRACT

Identifying relations between objects is central to understanding the scene. While several works have been proposed for relation modeling in the image domain, there have been many constraints in the video domain due to challenging dynamics of spatio-temporal interactions (e.g., Between which objects are there an interaction? When do relations occur and end?). To date, two representative methods have been proposed to tackle Video Visual Relation Detection (VidVRD): segment-based and window-based. We first point out the limitations these two methods have and propose Temporal Span Proposal Network (TSPN), a novel method with two advantages in terms of efficiency and effectiveness. 1) TSPN tells what to look: it sparsifies relation search space by scoring relationness (i.e., confidence score for the existence of a relation between pair of objects) of object pair. 2) TSPN tells when to look: it leverages the full video context to simultaneously predict the temporal span and categories of the entire relations. TSPN demonstrates its effectiveness by achieving new state-of-the-art by a significant margin on two VidVRD benchmarks (ImageNet-VidVDR and VidOR) while also showing lower time complexity than existing methods - in particular, twice as efficient as a popular segment-based approach.

研究の動機と目的

  • 動画内での対象ペアの相互作用とその発生時刻を特定する課題に取り組むこと。これは、複雑な空間時間的ダイナミクスに起因する。
  • 既存のセグメントベースおよびウィンドウベース手法における動画視覚的関係検出(VidVRD)の限界を克服すること。これらの手法は非効率で、時間的文脈の不完全なモデル化を抱える。
  • 関係カテゴリとその時系列スパンを統合的に予測するフレームワークを提案すること。関係度スコアリングを用いて検索空間を削減することで実現する。
  • 先行する最先端手法よりも高い精度と低い時間計算量を達成すること。VidVRDベンチマークで実現する。

提案手法

  • TSPNは、対象ペア間の関係が存在する確信度を評価する関係度スコアリング機構を導入し、関係の検索空間を疎にすることで、計算負荷を低減する。
  • 全動画の文脈を活用して、1回の順伝播処理で各検出された関係の時系列スパン(開始時刻と終了時刻)とカテゴリを同時に予測する。
  • 空間的および時間的特徴を符号化するための二重ストリームアーキテクチャを用い、時間的経過にわたる対象間相互作用の共同モデリングを可能にする。
  • 時系列スパン予測は、動画の時間的範囲に対して相対的な開始時刻と終了時刻を予測する回帰ヘッドによって実行される。
  • エンドツーエンド微分可能な形で対象検出と関係予測を統合し、同時に最適化が可能になる。
  • 関係度スコアリングを用いて低信頼度の対象ペアをフィルタリングすることで、計算コストを削減しつつ、検出精度を損なわない。

実験結果

リサーチクエスチョン

  • RQ1動画内の関係の検索空間を効果的に縮小しつつ、検出精度を維持する方法は何か?
  • RQ2全動画の文脈を活用することで、VidVRDにおける時系列スパンと関係カテゴリ予測にどのような影響を与えるか?
  • RQ3統合フレームワークは、既存のセグメントベースやウィンドウベース手法よりも、関係の内容と時間的持続期間を効率的に同時に予測できるか?
  • RQ4提案された関係度スコアリングは、先行手法と比較して、VidVRDの効率性と有効性をどの程度向上させるか?

主な発見

  • TSPNは、ImageNet-VidVDRおよびVidORベンチマークで、新たな最先端性能を達成しており、先行手法を顕著に上回っている。
  • 人気のあるセグメントベースVidVRD手法と比較して、2倍の高速化を達成しており、優れた効率性を示している。
  • 全動画の文脈を活用することで、関係の時系列局所化精度が向上し、相互作用が発生するタイミングを正確に予測可能になった。
  • 関係度スコアリング機構により、候補関係の数が効果的に削減され、計算量の低減が達成されたが、検出品質に悪影響を与えない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。