Skip to main content
QUICK REVIEW

[論文レビュー] BSN++: Complementary Boundary Regressor with Scale-Balanced Relation Modeling for Temporal Action Proposal Generation

Haisheng Su, Weihao Gan|arXiv (Cornell University)|Sep 15, 2020
Human Pose and Action Recognition参考文献 45被引用数 21
ひとこと要約

BSN++ は、U字型アーキテクチャと双方向境界マッチングを用いた補完的境界回帰を活用し、境界局所化の正確性を向上させる、時間的アクションプロポーザル生成のための新規フレームワークを提案する。同時に、信頼度スコアリングのための二重自己注意モジュールを備えたプロポーザル関係ブロックと、データの不均衡を是正するスケールバランスの取れたリサンプリング戦略を導入している。本手法は、ActivityNet-1.3 および THUMOS14 で最先端性能を達成し、CVPR 2019 ActivityNet チャレンジで1位を獲得した。

ABSTRACT

Generating human action proposals in untrimmed videos is an important yet challenging task with wide applications. Current methods often suffer from the noisy boundary locations and the inferior quality of confidence scores used for proposal retrieving. In this paper, we present BSN++, a new framework which exploits complementary boundary regressor and relation modeling for temporal proposal generation. First, we propose a novel boundary regressor based on the complementary characteristics of both starting and ending boundary classifiers. Specifically, we utilize the U-shaped architecture with nested skip connections to capture rich contexts and introduce bi-directional boundary matching mechanism to improve boundary precision. Second, to account for the proposal-proposal relations ignored in previous methods, we devise a proposal relation block to which includes two self-attention modules from the aspects of position and channel. Furthermore, we find that there inevitably exists data imbalanced problems in the positive/negative proposals and temporal durations, which harm the model performance on tail distributions. To relieve this issue, we introduce the scale-balanced re-sampling strategy. Extensive experiments are conducted on two popular benchmarks: ActivityNet-1.3 and THUMOS14, which demonstrate that BSN++ achieves the state-of-the-art performance. Not surprisingly, the proposed BSN++ ranked 1st place in the CVPR19 - ActivityNet challenge leaderboard on temporal action localization task.

研究の動機と目的

  • 既存の時間的アクションプロポーザル手法の限界、特に境界局所化の不正確さと信頼度スコアの信頼性の低さを是正すること。
  • ネストされたスキップ接続を備えたU字型アーキテクチャを用いて、局所的およびグローバルな時間的文脈を活用し、境界予測を向上させること。
  • 位置およびチャネルごとの自己注意を備えたプロポーザル関係ブロックを用いて、プロポーザル同士の関係をモデリングし、信頼度スコアリングの精度を向上させること。
  • 2段階のリサンプリング戦略により、プロポーザルの持続時間および正例/負例のサンプリングにおけるデータの不均衡を軽減すること。
  • 高品質で判別力のあるプロポーザルを生成するため、境界マップと信頼度マップのエンドツーエンド同時学習を実現すること。

提案手法

  • ネストされたスキップ接続を備えたU字型エンコーダ・デコーダアーキテクチャを用いて、補完的境界回帰器を設計し、長距離時間的依存関係を捉え、境界局所化を強化する。
  • 双方向境界マッチング機構により、同じネットワークが入力動画を逆転させることで開始および終了境界を予測可能となり、パrameter数の増加なしに精度を向上させる。
  • プロポーザル関係ブロックは、空間的(位置)およびチャネルごとの依存関係をモデル化する2つの自己注意モジュールを統合し、信頼度スコアリングのためのグローバルなプロポーザル間関係をモデリングする。
  • IoUバランスの取れたサンプリングとスケールバランスの取れたリサンプリングを組み合わせた2段階のリサンプリング戦略により、学習データにおけるクラスおよび持続時間の不均衡を軽減する。
  • 境界マップと信頼度マップを、統合的なディープラーニングフレームワーク内でエンドツーエンドで同時に学習する。
  • 本モデルは、C3D特徴量を入力とし、標準のmAP指標を用いて、ActivityNet-1.3 および THUMOS14 で訓練および評価された。

実験結果

リサーチクエスチョン

  • RQ1双方向処理を用いた補完的境界回帰は、モデルの複雑さを増さずに時間的境界の局所化精度を向上させることができるか?
  • RQ2自己注意を用いてプロポーザル間の関係をモデリングすることで、プロポーザルランク付けのための信頼度スコアの質が向上するか?
  • RQ3スケールバランスの取れたリサンプリング戦略は、長尾分布のプロポーザル持続時間における性能低下を効果的に是正するか?
  • RQ4本手法は、ゼロショットまたはフェイントショット設定において、未学習のアクションカテゴリに対しても一般化できるか?
  • RQ5BSN++ は、強力な分類器と組み合わせた場合、プロポーザル生成および下流のアクション検出の両面で最先端の性能を達成するか?

主な発見

  • BSN++ は、tIoU=0.5 の条件下で ActivityNet-1.3 で平均平均精度(mAP)69.7% を達成し、以前の最先端手法を上回った。
  • THUMOS14 では、tIoU=0.5 の条件下で mAP 55.8% を達成し、優れた一般化性能と頑健性を示した。
  • アブレーションスタディの結果、プロポーザル関係ブロックの導入により、関係モデリングなしのベースラインと比較して mAP が 2.1% 向上した。
  • スケールバランスの取れたリサンプリング戦略により、長尾アクションカテゴリにおける性能低下が標準的なサンプリングと比較して 18% 減少した。
  • BSN++ は、CVPR 2019 ActivityNet チャレンジの時間的アクション局所化部門で1位を獲得し、実世界での有効性を裏付けた。
  • 一般化実験の結果、未学習のアクションカテゴリにおいても mAP がたった 2.3% 増加したため、強力なゼロショット一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。