Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Feature Aggregation Networks for Video Action Recognition

Swathikiran Sudhakaran, Sérgio Escalera|arXiv (Cornell University)|May 29, 2019
Human Pose and Action Recognition参考文献 29被引用数 5
ひとこと要約

本稿では、畳み込みゲートを用いて隣接する特徴ブランチ間の動的で学習可能な相互作用を可能にする、軽量なモジュールである階層的特徴統合ネットワーク(HF-Net)を提案する。各層で特徴の差分と平均化のバランスをとることで、動的かつ学習可能な特徴統合を実現し、動的で学習可能な特徴統合を実現する。この手法により、Something-Nowで24%以上の性能向上が達成され、追加パラメータは1.14%、FLOPsは1.04%増加にとどまり、保守的なルーティングにより特徴の流れが保持される。

ABSTRACT

Most action recognition methods base on a) a late aggregation of frame level CNN features using average pooling, max pooling, or RNN, among others, or b) spatio-temporal aggregation via 3D convolutions. The first assume independence among frame features up to a certain level of abstraction and then perform higher-level aggregation, while the second extracts spatio-temporal features from grouped frames as early fusion. In this paper we explore the space in between these two, by letting adjacent feature branches interact as they develop into the higher level representation. The interaction happens between feature differencing and averaging at each level of the hierarchy, and it has convolutional structure that learns to select the appropriate mode locally in contrast to previous works that impose one of the modes globally (e.g. feature differencing) as a design choice. We further constrain this interaction to be conservative, e.g. a local feature subtraction in one branch is compensated by the addition on another, such that the total feature flow is preserved. We evaluate the performance of our proposal on a number of existing models, i.e. TSN, TRN and ECO, to show its flexibility and effectiveness in improving action recognition performance.

研究の動機と目的

  • 固定された統合戦略(例えば、硬直的な特徴差分計算やプーリング)の限界に対処すること。これらの戦略は、入力依存の時間的ダイナミクスに適応できない。
  • 3D畳み込みや外部のオプティカルフローに依存せずに、深層ネットワークが時間的受容 field を拡大できることを実現すること。
  • 既存の2D-CNNバックボーン(例:TSN、TRN、ECO)を最小限のパラメータおよびFLOPsの追加で強化できる、即挿し可能なモジュールを設計すること。
  • 各層で差分と平均化の間を動的に選択する畳み込みゲートを用いて、局所的に適応的な特徴統合を学習すること。
  • モバイルデプロイメントに適した低推論コストを維持しながら、行動認識ベンチマークで競争力のある性能を達成すること。

提案手法

  • コアとなるコンponentは、CNNバックボーンの各層で隣接する特徴ブランチに対して作用するHFモジュールである。
  • 各層で、ゲート付きの残差を計算する。特徴が1つのブランチから差し引かれ、隣接するブランチに加算され、学習可能な畳み込みゲートによって制御される。
  • ゲートはエンド・トゥ・エンドで学習され、局所的に特徴差分と平均化のどちらが適用されるかを決定する。これにより、適応的な時間的推論が可能になる。
  • 情報損失を防ぐために、特徴の総流入量がブランチ間で保持されるように、保守的なルーティングを強制する。
  • モジュールは即挿し可能であり、TSN、TRN、ECOを含む任意の2D-CNNベースの動画モデルと互換性を持つ。
  • ネットワークはエンド・トゥ・エンドで訓練され、ゲートが入力依存の統合戦略を学習可能となり、空間時間的表現学習が向上する。

実験結果

リサーチクエスチョン

  • RQ1隣接する特徴ブランチ間の学習可能で動的な相互作用は、固定された統合手法を上回る動画行動認識性能を実現できるか?
  • RQ23D畳み込みを用いずに、2D-CNNバックボーンの時間的受容 field を効果的に拡大できるか?
  • RQ3提案された階層的特徴統合は、計算コストを最小限に抑えながら性能向上を達成できるか?
  • RQ4この手法は、異なるバックボーンアーキテクチャやデータセットに一般化可能か?
  • RQ5低FLOPsおよびパラメータコストで、長時間のシーケンスや複雑な人物-オブジェクトインタラクション動画においても強力な性能を達成できるか?

主な発見

  • HF-Netは、TSNに適用した場合、Something-Nowデータセットで24.2%の精度向上を達成し、追加パラメータは1.14%、FLOPsは1.04%増加にとどまる。
  • HMDB51では、HFを拡張したモデル(TSN、TRN、ECOLite)が、すべてのベースラインで2%以上の精度向上を達成し、一部のケースではより大きな3D CNNを上回る性能を示した。
  • HF-TSNは、EPIC-KITCHENSのRGBおよびオプティカルフロー両ストリームで、動詞分類においてS1設定で12%、S2設定で8%の向上を達成した。
  • HF-Netは、Something-Now、HMDB51、EPIC-KITCHENSの3つのベンチマークすべてで競争力のある性能を達成し、計算コストを低く維持している。
  • ECOLite(完全な3D CNNよりも3D畳み込みが少ないモデル)においてもHFモジュールが性能向上をもたらし、階層的特徴統合が一部の状況で密度のある3D畳み込みよりも効果的であることを示した。
  • アブレーションスタディにより、学習可能なゲートが不可欠であることが確認され、固定された差分計算や平均化戦略は、適応的ルーティング機構に比べて性能が劣ることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。