Skip to main content
QUICK REVIEW

[論文レビュー] Long Short-Term Transformer for Online Action Detection

Mingze Xu, Yuanjun Xiong|arXiv (Cornell University)|Jul 7, 2021
Human Pose and Action Recognition参考文献 74被引用数 11
ひとこと要約

LSTRは、長期間にわたる動画シーケンス(最大8分間)を高い時間分解能でモデル化できる、オンラインアクション検出のための新しいTransformerベースのアーキテクチャを提案する。長期間記憶と短期記憶を明示的に分離することで、固定長の潜在表現に長期間履歴を圧縮し、それをクロスアテンションで参照しながら、細分化された短期的コンテキストを処理する。このアプローチにより、THUMOS’14、TVSeries、HACS Segmentのベンチマークで最先端の性能を達成し、ヒューリスティックに依存する必要を減らし、効率性を向上させた。

ABSTRACT

We present Long Short-term TRansformer (LSTR), a temporal modeling algorithm for online action detection, which employs a long- and short-term memory mechanism to model prolonged sequence data. It consists of an LSTR encoder that dynamically leverages coarse-scale historical information from an extended temporal window (e.g., 2048 frames spanning of up to 8 minutes), together with an LSTR decoder that focuses on a short time window (e.g., 32 frames spanning 8 seconds) to model the fine-scale characteristics of the data. Compared to prior work, LSTR provides an effective and efficient method to model long videos with fewer heuristics, which is validated by extensive empirical analysis. LSTR achieves state-of-the-art performance on three standard online action detection benchmarks, THUMOS'14, TVSeries, and HACS Segment. Code has been made available at: https://xumingze0308.github.io/projects/lstr

研究の動機と目的

  • オンラインアクション検出において、将来のフレームが入手不可である状況で、最大8分間の長期間にわたる動画シーケンスを効果的にモデル化する課題に対処すること。
  • 時間遡及バックプロパゲーションを必要とする再帰的モデルの限界を克服し、長距離依存関係を扱えるようにすること。
  • 過去のコンテキストを統合的にモデル化するのではなく、長期間記憶の文脈と短期的で細分化されたフレームレベルのダイナミクスを明示的に分離することで、時間的モデリングを改善すること。
  • ヒューリスティックなダウンサンプリングやプーリングを回避しながら、高精度を維持する効率的でエンドツーエンドのアーキテクチャを構築すること。

提案手法

  • LSTRは、長期間記憶(最大2048フレーム)と短期記憶(32フレーム)の2つの別々の記憶ストリームを持つ、エンコーダ・デコーダ型のTransformerアーキテクチャを採用する。
  • LSTRエンコーダは、2段階の記憶圧縮を用いて長期間履歴を固定長の潜在表現に圧縮し、長期間コンテキストのモデル化を効率的に行う。
  • LSTRデコーダは、短期フレームと圧縮された長期間記憶の間で自己アテンションとクロスアテンションを実行し、予測を精緻化する。
  • 因果的アテンション機構を用いることで、過去および現在の情報のみを用いることを保証し、オンライン推論の制約を満たす。
  • 時間遡及バックプロパゲーションの必要性を回避するため、再帰的ユニットを排除し、長期間記憶内の任意のフレームに直接アテンションを適用する。
  • 位置埋め込みと方向性マスクを追加することで、将来のトークンを含めた拡張が可能であり、アクション予測への応用をサポートする。

実験結果

リサーチクエスチョン

  • RQ1再帰的ユニットを用いずに、自己アテンション機構が最大8分間の長期間動画シーケンスをオンラインアクション検出で効果的にモデル化できるか。
  • RQ2長期間記憶と短期記憶を分離することで、過去コンテキストを統合的にモデル化する手法と比較して、性能がどのように向上するか。
  • RQ3長期間記憶を圧縮しても、細分化された時間的分解能をどの程度維持できるか。
  • RQ4LSTRは、動画長やアクション特性が異なる多様なデータセットに一般化できるか。
  • RQ5LSTRは、精度と計算効率の両面で、先行する最先端手法と比較してどのように差をつけるか。

主な発見

  • LSTRは、THUMOS’14、TVSeries、HACS Segmentの3つの標準ベンチマークで最先端の性能を達成した。
  • THUMOS’14において、LSTRは「HammerThrow」アクションで92.8%の平均平均精度(mAP)を達成し、評価されたすべての手法の中で最高であった。
  • 「PoleVault」と「LongJump」のような長時間で多段階的なアクションに対しても、それぞれ89.7%および86.9%のmAPを達成し、優れた性能を示した。
  • 「Billiards」(39.8% mAP)や「CricketShot」(38.6% mAP)のように、動きが少なく可視性が低いアクションでは精度が低下し、視覚的な微細な差に敏感であることが示された。
  • アブレーションスタディの結果、長期間記憶と短期記憶の分離が、モデリングの効率性と表現品質を顕著に向上させることを確認した。
  • 将来2秒先までのアクション予測にLSTRを拡張した場合、競争力のある結果が得られ、そのタスクへの適応可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。