Skip to main content
QUICK REVIEW

[論文レビュー] Depthwise Spatio-Temporal STFT Convolutional Neural Networks for Human Action Recognition

Sudhakar Kumawat, Manisha Verma|arXiv (Cornell University)|Jul 22, 2020
Human Pose and Action Recognition参考文献 75被引用数 56
ひとこと要約

本論文は、人間の行動認識を目的とした3D畳み込みニューラルネットワーク(3D CNN)における3D畳み込み層のパラメータ効率的な代替手段として、空間時間的短時間フーリエ変換(STFT)ブロックを提案する。空間的・時間的次元で局所的なフーリエ特徴を抽出するための学習不能なSTFTカーネルを用い、その後にチャネル相関をモデル化するための学習可能な線形重みを適用することで、パラメータ数を3.5–4.5倍、計算量を1.5–1.8倍削減しつつ、Kinetics-400やJesterを含む7つのベンチマークで最先端または優れた精度を達成した。

ABSTRACT

Conventional 3D convolutional neural networks (CNNs) are computationally expensive, memory intensive, prone to overfitting, and most importantly, there is a need to improve their feature learning capabilities. To address these issues, we propose spatio-temporal short term Fourier transform (STFT) blocks, a new class of convolutional blocks that can serve as an alternative to the 3D convolutional layer and its variants in 3D CNNs. An STFT block consists of non-trainable convolution layers that capture spatially and/or temporally local Fourier information using a STFT kernel at multiple low frequency points, followed by a set of trainable linear weights for learning channel correlations. The STFT blocks significantly reduce the space-time complexity in 3D CNNs. In general, they use 3.5 to 4.5 times less parameters and 1.5 to 1.8 times less computational costs when compared to the state-of-the-art methods. Furthermore, their feature learning capabilities are significantly better than the conventional 3D convolutional layer and its variants. Our extensive evaluation on seven action recognition datasets, including Something-something v1 and v2, Jester, Diving-48, Kinetics-400, UCF 101, and HMDB 51, demonstrate that STFT blocks based 3D CNNs achieve on par or even better performance compared to the state-of-the-art methods.

研究の動機と目的

  • 動画行動認識のための3D CNNにおける高い計算コスト、メモリ使用量、過学習の問題に対処すること。
  • 従来の3D畳み込みを置き換える新しいSTFTベースのブロックアーキテクチャを導入することで、3D CNNの特徴学習能力を向上させること。
  • 複数の行動認識データセットで最先端の性能を維持または上回る、パラメータ数および計算量に配慮したアーキテクチャを設計すること。
  • 動画モデリングにおける異なる空間時間的次元でのSTFTベースの特徴抽出の有効性を調査すること。

提案手法

  • ST-STFT(3D STFT)、S-STFT(2D空間的STFT+ディープワイズ時間的)、T-STFT(ディープワイズ空間的+1次元時間的STFT)の3つのバリエーションのSTFTブロックを提案。
  • 空間時間的ボリューム内の複数の低周波数ポイントで局所的なフーリエ係数を抽出するための学習不能なSTFTカーネルを採用。
  • STFT出力を処理するためのディープワイズ3D畳み込みを用い、空間的および時間的次元にわたる効率的な計算を実現。
  • STFT層の後に学習可能な線形重みを導入し、チャネル間相関をモデル化し、特徴表現を強化。
  • ボトルネックアーキテクチャ内にSTFTブロックを統合し、ResNetスタイルのネットワークにおける標準的な3D畳み込みを置き換え。
  • ImageNetの事前学習に依存せずに、Kinetics-400などの大規模データセットからスクラッチでモデルを学習させ、一般化性能を評価。

実験結果

リサーチクエスチョン

  • RQ1STFTベースのブロックは、性能を損なわずに3D CNNのパラメータ数とFLOPsを削減できるか?
  • RQ2STFTブロックは、従来の3D畳み込みや因子化された変種(例:R(2+1)D、S3D)と比較して、空間時間的特徴をどのように学習するか?
  • RQ3学習不能なSTFTカーネルの使用は、学習可能な3D畳み込みと比較して特徴表現を向上させるか?
  • RQ4Jester、Kinetics-400、UCF-101のような複雑さやサイズが異なるデータセットにおいて、STFTベースのモデルの性能はどのようにスケーリングするか?
  • RQ5Kineticsのような大規模データセットで事前学習したSTFTベースのモデルは、小規模データセットに対しても十分に一般化できるか?

主な発見

  • T-STFTバージョンはJesterデータセットで96.94%の精度を達成し、SOTAのSTMモデルを0.24%上回りながら、FLOPsは1.6倍少なく、パラメータ数は4.1倍も削減した。
  • Kinetics-400では、T-STFTモデルが61.1%のトップ1精度を達成し、パラメータ数を5.2倍も削減したR(2+1)D-ResNet18ベースライン(56.8%)を上回った。
  • ST-STFTブロックはKinetics-400で39.4%のトップ1精度を達成し、極めて少ないパラメータ数で強力な性能を示した。
  • UCF-101およびHMDB-51では、Kineticsで事前学習したSTFTモデルがそれぞれ94.7%および71.5%の精度を達成し、ImageNet+Kineticsで事前学習したSOTAモデルと同等の性能を示した。
  • パラメータ数がSOTAと比較して著しく削減(3–5倍)されたことにより、スクラッチ学習時においても過学習に対するロバスト性が向上した。
  • Jesterのような時間的要因が複雑なデータセットや、Kinetics-400のような大規模なシーンデータセットを含む多様なデータセットにおいて、一貫した性能向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。