Skip to main content
QUICK REVIEW

[論文レビュー] Temporal attention filters for human activity recognition in videos.

AJ Piergiovanni, Chenyou Fan|arXiv (Cornell University)|May 26, 2016
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、可変期間の部分イベントをモデル化することで、動画における人間の行動認識を向上させるための微分可能時間的アテンションフィルタを導入する。この手法は、静的またはLSTMで学習された動的フィルタを用いて関連する時間的セグメントに注目し、畳み込みニューラルネットワーク(CNN)と共同でエンド・ツー・エンドの学習を可能にし、明示的な時間的構造の捉え込みにより認識精度を向上させる。

ABSTRACT

In this paper, we newly introduce the concept of temporal attention filters, and describe how they can be used for human activity recognition from videos. Many high-level activities are often composed of multiple temporal parts (e.g., sub-events) with different duration/speed, and our objective is to make the model explicitly consider such temporal structure using multiple temporal filters. Our attention filters are designed to be fully differentiable, allowing end-of-end training of the temporal filters together with the underlying frame-based or segment-based convolutional neural network architectures. The paper not only presents an approach of learning optimal static temporal attention filters to be shared across different videos, but also describes an approach of dynamically adjusting attention filters per testing video using recurrent long short-term memory networks (LSTMs). We experimentally confirm that the proposed concept of temporal attention filters benefits the activity recognition tasks by capturing the temporal structure in videos.

研究の動機と目的

  • 動画における可変期間の部分イベントとその速度の違いを有する高レベルの行動を認識する課題に対処すること。
  • 認識性能の向上を図るため、動画シーケンスにおける時間的構造を明示的にモデル化するメカニズムを開発すること。
  • 畳み込みニューラルネットワークと共同で学習可能な完全に微分可能な時間的アテンションフィルタを設計すること。
  • 個々の動画ごとの最適化を目的としたLSTMを用いた、静的および動的適応型アテンションフィルタの検討。

提案手法

  • 時間的セグメントに注目する学習可能で微分可能なモジュールとしての時間的アテンションフィルタを提案する。
  • すべての動画に共有される静的時間的アテンションフィルタを導入し、エンド・ツー・エンドの学習中に最適化する。
  • 入力動画シーケンスごとにフィルタパラメータを適応的に調整するためのLSTMを用いた動的アテンション機構を開発する。
  • フレームベースまたはセグメントベースのCNNアーキテクチャとアテンションフィルタを統合し、共同最適化を実現する。
  • 時間の逆伝播と標準的な逆伝播を用いて、アテンションフィルタおよびその下位にあるCNNを学習する。
  • 時間窓全体にわたる学習可能なアテンション重み分布を用いて、重要な部分イベントに注目する。

実験結果

リサーチクエスチョン

  • RQ1学習可能な時間的アテンションフィルタは、可変期間の部分イベントを有する複雑な人間の行動認識を向上させることができるか?
  • RQ2微分可能な時間的アテンションフィルタの統合は、動画ベースの行動認識性能を向上させるか?
  • RQ3LSTMによる動的アテンションは、静的アテンションと比較して、多様な時間的構造のモデル化においてどのように異なるか?
  • RQ4アテンションメカニズムは、動画認識におけるCNNと効果的にエンド・ツー・エンドで学習可能か?

主な発見

  • 提案された時間的アテンションフィルタは、動画内の可変期間の部分イベントを明示的にモデル化することで、行動認識性能を向上させる。
  • 微分可能なアテンションフィルタの使用により、CNNと共同でエンド・ツー・エンドの学習が可能となり、特徴抽出と時間的整合性の向上が図られる。
  • LSTMによる動的アテンションにより、個々の動画に応じた時間的注目領域の適応が可能となり、時間的ばらつきに対するロバスト性が向上する。
  • 明示的な時間的アテンション機構を備えないベースラインモデルと比較して、認識精度が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。