Skip to main content
QUICK REVIEW

[論文レビュー] CBR-Net: Cascade Boundary Refinement Network for Action Detection: Submission to ActivityNet Challenge 2020 (Task 1)

Xiang Wang, Baiteng Ma|arXiv (Cornell University)|Jun 13, 2020
Human Pose and Action Recognition参考文献 6被引用数 7
ひとこと要約

本論文では、時系列行動検出のための段階的境界精錬ネットワークであるCBR-Netを提案する。提案手法は、複数段階の精錬モジュールを用いて境界を精錬することで、提案の正確性を向上させる。複数のバックボーン(TSN、I3D、Slowfast)を組み合わせ、BMNをベースラインとして用い、アンサンブル戦略を適用することで、ActivityNet v1.3で42.788%のmAPを達成し、ActivityNet Challenge 2020 Task 1で1位を獲得した。

ABSTRACT

In this report, we present our solution for the task of temporal action localization (detection) (task 1) in ActivityNet Challenge 2020. The purpose of this task is to temporally localize intervals where actions of interest occur and predict the action categories in a long untrimmed video. Our solution mainly includes three components: 1) feature encoding: we apply three kinds of backbones, including TSN [7], Slowfast[3] and I3d[1], which are both pretrained on Kinetics dataset[2]. Applying these models, we can extract snippet-level video representations; 2) proposal generation: we choose BMN [5] as our baseline, base on which we design a Cascade Boundary Refinement Network (CBR-Net) to conduct proposal detection. The CBR-Net mainly contains two modules: temporal feature encoding, which applies BiLSTM to encode long-term temporal information; CBR module, which targets to refine the proposal precision under different parameter settings; 3) action localization: In this stage, we combine the video-level classification results obtained by the fine tuning networks to predict the category of each proposal. Moreover, we also apply to different ensemble strategies to improve the performance of the designed solution, by which we achieve 42.788% on the testing set of ActivityNet v1.3 dataset in terms of mean Average Precision metrics.

研究の動機と目的

  • 未編集動画における時系列行動局所化の正確性を向上させるために、提案境界を精錬する。
  • BMNのような固定境界解像度の制限を抱える従来手法の限界を、段階的精錬機構によって克服する。
  • 複数バックボーン特徴抽出とモデルアンサンブル戦略を用いて、検出性能を向上させる。
  • 時系列行動検出において、ActivityNet Challenge 2020で最先端の結果を達成する。

提案手法

  • 本手法は、15 FPSの動画クリップに対して、事前学習済みの3つのバックボーン(TSN、I3D、Slowfast)を用いてスニペットレベルの特徴量を抽出する。
  • 提案生成にはBMNをベースラインとして用い、新たな段階的境界精錬(CBR)モジュールを導入して、複数段階にわたる提案境界の精錬を実現する。
  • CBRモジュールは、段階的な回帰ヘッドのスタックを用いて、提案の開始および終了境界を段階的に精錬し、精度を向上させる。
  • BiLSTMを用いた時系列特徴符号化モジュールが、動画セグメント全体にわたる長距離依存性を捉える。
  • 微調整済みのネットワークから得られる動画レベル分類スコアを融合し、各提案の行動カテゴリを予測する。
  • アンサンブル戦略により、CBR-Net、BSN、BMNの予測結果を統合し、テストセットでの性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1固定解像度手法(例:BMN)を上回る精度を実現するため、段階的境界精錬機構が提案の局所化精度を向上させられるか?
  • RQ2複数バックボーン特徴量の統合は、時系列行動検出性能の向上にどの程度効果的か?
  • RQ3モデルアンサンブル戦略は、ActivityNet Challenge 2020の設定下でmAPの向上にどの程度寄与するか?
  • RQ4時系列符号化にBiLSTMを組み込むことで、行動検出における長距離特徴表現が向上するか?

主な発見

  • CBR-Netはバリデーションセットで38.0%のmAPを達成し、元のBMNベースラインより2.65ポイント高い性能を示した。
  • CBR-Net、BSN、BMNのアンサンブルは、テストセットで42.788%のmAPを達成し、ActivityNet Challenge 2020 Task 1で1位を獲得した。
  • 提案されたCBRモジュールは、計算コストを著しく増加させることなく、提案境界の精錬を効果的に行うことができた。
  • 多様な特徴量の統合とモデルアンサンブル戦略は、検出性能を顕著に向上させ、異なるアーキテクチャ間の相乗効果を示した。
  • 本手法は優れた一般化性能を示し、同じ特徴抽出および学習テクニックを用いて再訓練した場合、BSNとBMNのベースラインはそれぞれ2.77%および2.65%のmAP向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。