Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Dynamic Graph LSTM for Action-driven Video Object Detection

Yuan Yuan, Xiaodan Liang|arXiv (Cornell University)|Aug 2, 2017
Human Pose and Action Recognition参考文献 43被引用数 14
ひとこと要約

本論文は、行動記述を教師信号として用いることでラベル欠落問題を克服する、アクション駆動型弱教師付き動画オブジェクト検出のための時系列動的グラフLSTM(TD-Graph LSTM)を提案する。フレーム間のオブジェクト候補同士の視覚的相関に基づいて時系列グラフを動的に構築することで、グローバルな時系列推論と知識の転送を可能にし、Charadesデータセットにおいて1.98%の検出mAPおよび19.52%の分類mAPを達成し、最先端の性能を実現した。

ABSTRACT

In this paper, we investigate a weakly-supervised object detection framework. Most existing frameworks focus on using static images to learn object detectors. However, these detectors often fail to generalize to videos because of the existing domain shift. Therefore, we investigate learning these detectors directly from boring videos of daily activities. Instead of using bounding boxes, we explore the use of action descriptions as supervision since they are relatively easy to gather. A common issue, however, is that objects of interest that are not involved in human actions are often absent in global action descriptions known as "missing label". To tackle this problem, we propose a novel temporal dynamic graph Long Short-Term Memory network (TD-Graph LSTM). TD-Graph LSTM enables global temporal reasoning by constructing a dynamic graph that is based on temporal correlations of object proposals and spans the entire video. The missing label issue for each individual frame can thus be significantly alleviated by transferring knowledge across correlated objects proposals in the whole video. Extensive evaluations on a large-scale daily-life action dataset (i.e., Charades) demonstrates the superiority of our proposed method. We also release object bounding-box annotations for more than 5,000 frames in Charades. We believe this annotated data can also benefit other research on video-based object recognition in the future.

研究の動機と目的

  • アクション記述に含まれないオブジェクトカテゴリが頻繁に検出されないという、弱教師付き動画オブジェクト検出におけるラベル欠落問題に対処すること。
  • 動画内の時系列的整合性を活用し、アクションラベル付きフレームからラベルなしフレームの未関与オブジェクトへ知識を転送すること。
  • フレーム間のオブジェクト候補間の時系列相関を適応的にモデル化する動的グラフに基づく再帰的アーキテクチャを設計すること。
  • 最小限の監視情報で、日常の動画シナリオにおける小形・隠蔽オブジェクトの検出性能を向上させること。
  • 今後の動画認識研究を支援するため、5,000フレーム以上のバウンディングボックスを含む新しいアノテート済みデータセットを公開すること。

提案手法

  • TD-Graph LSTMは、すべてのフレームにおけるオブジェクト候補をノードとする動的時系列グラフを構築し、隣接フレームの候補間の視覚的類似度に基づいてエッジを適応的に形成する。
  • 各時刻で、最も類似度の高い候補同士のみがエッジで接続され、グラフ全体を通じて文脈に適応した情報伝搬が可能になる。
  • LSTMユニットを用いて動的グラフに沿った順序特徴を処理することで、長距離の時系列推論と特徴の精錬が可能になる。
  • エッジは現在の特徴表現に基づいて反復的に更新され、学習された視覚的相関に基づいて接続性が進化する。
  • 動的グラフ構造を通じて、全動画にわたってアクション知識を伝達することで、検出と分類を同時に最適化する。
  • アブレーションスタディでは、動的グラフと静的・完全接続型・平均重み付きグラフを比較し、適応的トポロジー学習の有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1弱教師付き検出におけるラベル欠落問題を軽減するために、動画内のオブジェクト候補間の時系列相関を効果的にモデル化できるか?
  • RQ2時間的に進化する状態とトポロジーを持つ動的グラフ構造は、固定または静的グラフトポロジーと比較して検出性能を向上させるか?
  • RQ3明示的にラベルが付与されていないにもかかわらず、行動記述を効果的に活用して、フレーム全体にわたって未関与オブジェクトの存在を推定できるか?
  • RQ4動的グラフ上でLSTMを用いた時系列推論を統合することで、小形・隠蔽オブジェクトの検出精度にどのような影響を与えるか?
  • RQ5部分的なラベルしか入手できない状況下で、グローバルな動画レベルのアクション知識が、フレームレベルのオブジェクト検出にどの程度向上効果をもたらすか?

主な発見

  • 提案されたTD-Graph LSTMは、Charadesデータセットで検出mAP 1.98%、分類mAP 19.52%を達成し、最先端手法よりも分類mAPで3.85%の向上を示した。
  • 小形オブジェクトの検出性能は、ピロークラスで14.13%以上、カップクラスで6.93%以上向上し、困難な検出シナリオにおける有効性を示した。
  • アブレーションスタディにより、動的グラフ構造が静的および平均重み付きグラフベースラインを顕著に上回ることが確認され、適応的エッジ選択の価値が裏付けられた。
  • グラフ部品を削除すると検出mAPが1.55%に低下し、グラフベースの知識転送が性能向上に不可欠であることが確認された。
  • LSTMユニットを備えたモデルは、LSTMなしのバージョンよりも優れた性能を示し、複雑な運動パターンを捉えるための順序モデリングの重要性が裏付けられた。
  • 定性的な結果では、カップやソファーのような小形・隠蔽オブジェクトについて、ベースラインと比較して優れた検出精度を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。