Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Action Proposal Generation with Transformers

Lining Wang, Haosen Yang|arXiv (Cornell University)|May 25, 2021
Human Pose and Action Recognition参考文献 37被引用数 16
ひとこと要約

本稿では、長距離フレームレベルの依存関係をモデル化する境界変換器(Boundary Transformer)と、スパースサンプリングを用いて提案同士の関係を捉えることで信頼性の高いスコア予測を実現する提案変換器(Proposal Transformer)を備えた、2つの特化型変換器を用いる統合フレームワーク、TAPG Transformerを提案する。この手法は、ActivityNet-1.3およびTHUMOS14ベンチマークで最先端の性能を達成し、提案品質および局所化精度の面で先行手法を上回っている。

ABSTRACT

Transformer networks are effective at modeling long-range contextual information and have recently demonstrated exemplary performance in the natural language processing domain. Conventionally, the temporal action proposal generation (TAPG) task is divided into two main sub-tasks: boundary prediction and proposal confidence prediction, which rely on the frame-level dependencies and proposal-level relationships separately. To capture the dependencies at different levels of granularity, this paper intuitively presents a unified temporal action proposal generation framework with original Transformers, called TAPG Transformer, which consists of a Boundary Transformer and a Proposal Transformer. Specifically, the Boundary Transformer captures long-term temporal dependencies to predict precise boundary information and the Proposal Transformer learns the rich inter-proposal relationships for reliable confidence evaluation. Extensive experiments are conducted on two popular benchmarks: ActivityNet-1.3 and THUMOS14, and the results demonstrate that TAPG Transformer outperforms state-of-the-art methods. Equipped with the existing action classifier, our method achieves remarkable performance on the temporal action localization task. Codes and models will be available.

研究の動機と目的

  • 従来の時系列行動提案生成(TAPG)手法が、長距離の文脈モデリングを欠いている、あるいは提案レベルの関係をモデル化できないという限界を是正すること。
  • フレームレベルと提案レベルの依存関係を、1つの変換器ベースのフレームワークで統合的にモデル化することで、境界予測と信頼性予測の両方を向上させること。
  • 密な提案生成に代えてスパースな提案サンプリング機構を導入することで、計算負荷とクラス不均衡を軽減すること。
  • 既存の行動分類器と統合することで、時系列行動局所化性能を向上させること。

提案手法

  • 境界変換器は、全動画特徴シーケンスを処理し、自己注意機構を用いて長距離の時系列依存関係をモデル化することで、正確な行動境界確率を予測する。
  • 提案変換器は、新規のスパースサンプリング機構によって生成された、候補となる提案のスパースな集合上で動作し、提案間の関係を学習することで信頼性スコアを予測する。
  • 曖昧なマッチング機構により、予測された境界確率と提案信頼性スコアが一致し、最終的な提案が生成される。
  • スパースサンプリング機構は、異なるストライド(例:5, 3, 2)を用いたスライディングウィンドウ、またはフィボナッチベースの間隔を用いることで、重複を低減し、計算コストを削減する。
  • 変換器デコーダーにおける変更を加えたクエリ形式を採用し、元の動画特徴をクエリとして使用することで、グローバルノイズを抑制し、境界アーチファクトをなめらかにする。
  • マルチレイヤー変換器アーキテクチャを採用しており、アブレーションスタディにより、3層のスタックで最適な性能が得られると判明している。

実験結果

リサーチクエスチョン

  • RQ1統合型の変換器ベースのフレームワークは、時系列行動提案生成において、フレームレベルと提案レベルの両方の依存関係を効果的にモデル化できるか?
  • RQ2スパースな提案サンプリングは、密な提案生成と比較して、性能と計算効率の面で優れているか?
  • RQ3変換器デコーダーにおける異なるクエリ形式は、境界予測精度とノイズ耐性にどのような影響を与えるか?
  • RQ4境界変換器および提案変換器に最適な層数はいくつで、性能と過学習のバランスを最適化できるか?

主な発見

  • TAPG Transformerは、ActivityNet-1.3およびTHUMOS14の両ベンチマークで最先端の性能を達成し、提案生成の平均平均適合率(mAP)において、先行する最先端手法を上回っている。
  • スパースサンプリング機構により、元の提案数の約7.5%にまで削減されたが、性能は向上しており、効率性と有効性の両立が示された。
  • 変換器デコーダーで元の動画特徴をクエリとして使用することで、最良の性能が得られ、過剰平滑化とノイズ感受性が低減された。
  • 境界変換器および提案変換器に3層をスタックすることで最適な性能が得られ、より深いネットワークでは過学習と性能劣化が生じた。
  • 可視化結果から、モデルはノイズが多い、または曖昧なシーン(例:背景と行動のフレームが類似している)であっても、正しく行動を局所化できていることが示された。
  • 本手法は、複数の行動インスタンスを含む複雑な動画に対しても一般化性能が高く、トップ-kの提案が正しく真のラベルに一致している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。