Skip to main content
QUICK REVIEW

[論文レビュー] LP-3DCNN: Unveiling Local Phase in 3D Convolutional Neural Networks

Sudhakar Kumawat, Shanmuganathan Raman|arXiv (Cornell University)|Apr 6, 2019
Human Pose and Action Recognition参考文献 47被引用数 5
ひとこと要約

本稿では、3次元短時間フーリエ変換(STFT)を用いて低周波数で局所位相特徴を抽出し、ReLU活性化および学習可能な線形結合を経て、標準的な3次元畳み込み層の効率的な代替手段として、リカチフィード・ローカルフェーズボリューム(ReLPV)ブロックを提案する。ReLPVブロックは、パrameterを最大13³倍まで削減でき、ModelNet10/40およびUCF-101において、それぞれ先行SOTAモデルの11%および15%のパラメータで最先端の精度を達成する。

ABSTRACT

Traditional 3D Convolutional Neural Networks (CNNs) are computationally expensive, memory intensive, prone to overfit, and most importantly, there is a need to improve their feature learning capabilities. To address these issues, we propose Rectified Local Phase Volume (ReLPV) block, an efficient alternative to the standard 3D convolutional layer. The ReLPV block extracts the phase in a 3D local neighborhood (e.g., 3x3x3) of each position of the input map to obtain the feature maps. The phase is extracted by computing 3D Short Term Fourier Transform (STFT) at multiple fixed low frequency points in the 3D local neighborhood of each position. These feature maps at different frequency points are then linearly combined after passing them through an activation function. The ReLPV block provides significant parameter savings of at least, 3^3 to 13^3 times compared to the standard 3D convolutional layer with the filter sizes 3x3x3 to 13x13x13, respectively. We show that the feature learning capabilities of the ReLPV block are significantly better than the standard 3D convolutional layer. Furthermore, it produces consistently better results across different 3D data representations. We achieve state-of-the-art accuracy on the volumetric ModelNet10 and ModelNet40 datasets while utilizing only 11% parameters of the current state-of-the-art. We also improve the state-of-the-art on the UCF-101 split-1 action recognition dataset by 5.68% (when trained from scratch) while using only 15% of the parameters of the state-of-the-art. The project webpage is available at https://sites.google.com/view/lp-3dcnn/home.

研究の動機と目的

  • 標準的な3次元CNNの高い計算コスト、メモリ使用量、パラメータ数の問題に対処すること。
  • より効率的で情報量の多いモジュールに標準的な3次元畳み込み層を置き換えることで、3次元CNNの特徴学習能力を向上させること。
  • 過学習とモデルサイズを低減しつつ、3次元データタスクにおける性能を維持または向上させること。
  • ボリュメトリックデータや時空間的データを含む、多様な3次元データ表現において一貫した性能向上を示すこと。

提案手法

  • ReLPVブロックは、各入力位置の局所n×n×n近傍内で複数の固定された低周波数点において3次元短時間フーリエ変換(STFT)を計算する。
  • 3次元局所ボリューム内のSTFT出力から局所位相情報を抽出し、方向性および構造的特徴を捉える。
  • 異なる周波数点における位相応答をReLU活性化関数に通して、活性化応答マップを生成する。
  • これらの活性化マップは、学習可能な重みを用いて線形結合され、最終的な出力特徴マップが形成される。
  • ReLPVブロックは、3次元CNNアーキテクチャ内の標準的な3次元畳み込み層の即時交換可能なプラグインとして設計されている。
  • この手法により、フィルターサイズが3×3×3から13×13×13の場合、標準的な3次元畳み込みと比較して3³〜13³倍もパラメータを削減可能であり、特徴表現の向上が図られる。

実験結果

リサーチクエスチョン

  • RQ13次元STFTを用いて局所位相情報を活用する新しい3次元畳み込みブロックが、精度と効率の面で標準的な3次元畳み込みを上回ることができるか?
  • RQ2ReLPVブロックは、3次元CNNにおけるモデルの複雑さと過学習をどのように低減させ、特徴学習を強化するのか?
  • RQ3ReLPVブロックは、ボリュメトリック形状や時空間的アクションシーケンスを含む、さまざまな3次元データ表現に一般化可能か?
  • RQ4パフォーマンスを最大化しつつパラメータを最小限に抑えるために最適なReLPVブロックハイパーパramータ設定(n, f)は何か?
  • RQ5ReLPVブロックと標準的な3次元畳み込みを組み合わせたハイブリッドアーキテクチャは、完全にReLPVベースのモデルを上回る性能を発揮できるか?

主な発見

  • ReLPVブロックは、フィルターサイズが3×3×3から13×13×13の標準的な3次元畳み込みと比較して、少なくとも3³〜13³倍のトレーニング可能なパラメータを削減する。
  • ModelNet10およびModelNet40データセットにおいて、ReLPVベースのモデルは、現在のSOTAモデルの11%のパラメータで最先端の精度を達成する。
  • UCF-101スプリット-1のアクション認識データセットにおいて、ReLPVモデルは、スクラッチから訓練した場合、先行SOTAモデルと比較して5.68%の精度向上を達成し、そのパラメータはわずか15%にとどまる。
  • UCF-101データセットにおける性能は、特徴マップ数(f)の増加に伴い向上するが、モデルサイズやパラメータ数の増加はわずかである。
  • 標準的な3次元CNNの上位層をReLPVブロックに置き換えたハイブリッドモデルは性能向上を示すが、完全にReLPVベースのLP-mC3Dネットワークには及ばない。
  • アブレーションスタディの結果、ReLPVブロックの性能は、ハイパーパramータやデータタイプの変化に対しても頑健であり、常に標準的な3次元畳み込みよりも優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。