Skip to main content
QUICK REVIEW

[論文レビュー] Towards High-Quality Temporal Action Detection with Sparse Proposals

Jiannan Wu, Peize Sun|arXiv (Cornell University)|Sep 18, 2021
Human Pose and Action Recognition参考文献 46被引用数 6
ひとこと要約

本論文は、中間バックボーン層からの高解像度特徴量と提案領域との間で疎かつ局所的な相互作用を用いる、クエリベースの時系列行動検出フレームワーク、SP-TADを提案する。これにより、長時間・短時間の行動インスタンスにおける境界局所化性能が向上する。THUMOS14では最先端の結果(mAP@Avg 53.5%)を達成し、ActivityNet-1.3でも競争力ある性能を示す。グローバルアテンション手法と比較して計算複雑度が低いため、高速な推論が可能である。

ABSTRACT

Temporal Action Detection (TAD) is an essential and challenging topic in video understanding, aiming to localize the temporal segments containing human action instances and predict the action categories. The previous works greatly rely upon dense candidates either by designing varying anchors or enumerating all the combinations of boundaries on video sequences; therefore, they are related to complicated pipelines and sensitive hand-crafted designs. Recently, with the resurgence of Transformer, query-based methods have tended to become the rising solutions for their simplicity and flexibility. However, there still exists a performance gap between query-based methods and well-established methods. In this paper, we identify the main challenge lies in the large variants of action duration and the ambiguous boundaries for short action instances; nevertheless, quadratic-computational global attention prevents query-based methods to build multi-scale feature maps. Towards high-quality temporal action detection, we introduce Sparse Proposals to interact with the hierarchical features. In our method, named SP-TAD, each proposal attends to a local segment feature in the temporal feature pyramid. The local interaction enables utilization of high-resolution features to preserve action instances details. Extensive experiments demonstrate the effectiveness of our method, especially under high tIoU thresholds. E.g., we achieve the state-of-the-art performance on THUMOS14 (45.7% on mAP@0.6, 33.4% on mAP@0.7 and 53.5% on mAP@Avg) and competitive results on ActivityNet-1.3 (32.99% on mAP@Avg). Code will be made available at https://github.com/wjn922/SP-TAD.

研究の動機と目的

  • 密な提案手法の制限、例えば高い計算コストやアンカーやしきい値といった手作業で設計された要素への感受性を解消すること。
  • 特に短時間および変動する期間を持つ行動に対して、クエリベース手法とアンカーベース手法の間の性能格差を是正すること。
  • グローバルアテンションを避けて局所的かつ階層的な特徴相互作用を用いることで、高解像度特徴量の活用を可能にし、正確な境界局所化を実現すること。
  • RGBとオプティカルフローのストリームを早期に統合する統一的でエンドツーエンドで学習可能なフレームワークを構築すること。

提案手法

  • SP-TADは、行動インスタンスを予測するために学習可能なクエリを少数用いる。これにより、密なアンカー生成を避けるシンプルなクエリベースの検出パイプラインが実現される。
  • 各提案が時系列特徴ピラミッドの局所的セグメントにのみ注目する、新規の疎な相互作用メカニズムを導入。これにより、中間バックボーン層からの高解像度の詳細が保持される。
  • バックボーンの中間層からの特徴量を用いて時系列特徴ピラミッド(TFPN)を構築。これにより、ダウンサンプリングによる損失なしにマルチスケール表現が可能になる。
  • スタックされた検出ヘッドを用いた反復的リファインメントにより、段階的に提案境界を改善。これにより、局所化精度が向上する。
  • 検出ヘッドが予測する分類スコアを補正するための行動分類ヘッドを追加。これにより、全体の精度が向上する。
  • モデルは、RGBとオプティカルフローの2ストリーム入力からエンドツーエンドで学習され、特徴量を早期に統合する統一アーキテクチャを採用。ラテンフュージョンや複雑なパイプラインを避ける。

実験結果

リサーチクエスチョン

  • RQ1密な提案や手作業で設計されたアンカーに依存せずに、クエリベース手法が時系列行動検出で最先端の性能を達成できるか?
  • RQ2高解像度特徴量との局所的で疎な相互作用は、短時間および長時間の行動インスタンスにおける境界局所化をどのように改善するか?
  • RQ3バックボーンの中間層特徴量を用いることで、特徴量の解像度と検出品質にどのような影響を与えるか?
  • RQ4反復的リファインメントは、高IOU閾値におけるmAP向上にどのように寄与するか?
  • RQ5エンドツーエンド最適化を用いたRGBとオプティカルフローのストリームの早期統合は、ラテンフュージョンや2ストリーム別々のネットワークを上回る性能を発揮できるか?

主な発見

  • SP-TADはTHUMOS14で53.5% mAP@Avg、45.7% mAP@0.6、33.4% mAP@0.7を達成し、特に高IOU閾値での性能が顕著に優れている。
  • 時系列特徴ピラミッドにおける中間層特徴量の使用は、特に短時間の行動インスタンスにおいて境界局所化を向上させ、mAP@0.6およびmAP@0.7の向上によりその有効性が示された。
  • 4つのスタックされた検出ヘッドを用いた反復的リファインメント戦略が最良の性能をもたらし、単一ヘッドと比較してmAP@Avgが6.0%向上した。これはその必要性と有効性を示している。
  • 行動分類ヘッドの追加により、THUMOS14におけるmAP@Avgは52.1%から53.5%に向上した。これは検出ヘッドの分類誤差を是正する価値があることを証明している。
  • クリップ長が256トークンのときに最適なバランスが達成され、98%の行動インスタンスをカバーし、最高のmAPを達成した。これより長くも短くもすると性能が低下した。
  • 可視化結果から、SP-TADはAFSDなどの最先端手法と比較して、特に高IOU閾値下で真値に近いより正確な時系列境界を生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。