Skip to main content
QUICK REVIEW

[論文レビュー] Pooling the Convolutional Layers in Deep ConvNets for Action Recognition

Shichao Zhao, Yanbin Liu|arXiv (Cornell University)|Nov 6, 2015
Human Pose and Action Recognition参考文献 35被引用数 7
ひとこと要約

本論文は、空間特徴としてVGGNet、運動特徴としてTwo-Stream ConvNetsを用い、トラジェクトリープーリングとラインプーリングの2つの時間的プーリング戦略を採用することで、深層ConvNetからの畳み込み特徴をプールする新規フレームワークを提案する。VLADを用いた効果的な時間的符号化と、より深いネットワーク特徴の活用により、UCF101で93.78%、HMDB51で65.62%の最先端性能を達成した。

ABSTRACT

Deep ConvNets have shown its good performance in image classification tasks. However it still remains as a problem in deep video representation for action recognition. The problem comes from two aspects: on one hand, current video ConvNets are relatively shallow compared with image ConvNets, which limits its capability of capturing the complex video action information; on the other hand, temporal information of videos is not properly utilized to pool and encode the video sequences. Towards these issues, in this paper, we utilize two state-of-the-art ConvNets, i.e., the very deep spatial net (VGGNet) and the temporal net from Two-Stream ConvNets, for action representation. The convolutional layers and the proposed new layer, called frame-diff layer, are extracted and pooled with two temporal pooling strategy: Trajectory pooling and line pooling. The pooled local descriptors are then encoded with VLAD to form the video representations. In order to verify the effectiveness of the proposed framework, we conduct experiments on UCF101 and HMDB51 datasets. It achieves the accuracy of 93.78\% on UCF101 which is the state-of-the-art and the accuracy of 65.62\% on HMDB51 which is comparable to the state-of-the-art.

研究の動機と目的

  • 複雑な空間時間的行動パターンを捉えるために、標準的な浅い動画ConvNetの限界を解消すること。
  • 効果的なプーリング戦略の設計により、深層動画表現における時間的情報の活用を向上させること。
  • 非常に深いネットワーク(例:VGGNet)およびオプティカルフロー・ストリームを活用して、より豊かな特徴抽出を実現すること。
  • 標準ベンチマークで、手作業特徴や先行する深層学習手法を上回る性能を達成すること。

提案手法

  • フレームワークは、空間ストリームとしてVGGNet、時間ストリームとしてTwo-Stream ConvNetsのオプティカルフロー・ストリームを用い、中間畳み込み層から特徴を抽出する。
  • 連続フレーム間の画素単位の差分を計算することで、動き表現を強化する新しいフレーム・ディファレンス層を導入する。
  • 2つの時間的プーリング戦略を提案:トラジェクトリープーリング(動きの軌跡に沿って特徴を整列)、ラインプーリング(時間的ラインに沿ってプール)。
  • 複数の層(例:Conv5およびDiff5)からのプール済み特徴を、学習済みコードブックを用いたVLADで符号化し、最終的な動画表現を生成する。
  • 空間ストリームと時間ストリームの特徴を統合し、アブレーションスタディーに従って層選択を最適化する。
  • プール後、VLAD符号化を適用して局所記述子をコン act なグローバルな動画表現に集約する。

実験結果

リサーチクエスチョン

  • RQ1標準の動画ネットワークが比較的浅い場合に、より深いConvNetを動画行動認識で効果的に活用する方法は何か?
  • RQ2平均プーリングと比較して、動画シーケンス内の時間的変動をより効果的に捉えるプーリング戦略は何か?
  • RQ3フレーム差分特徴の統合は、深層動画モデルにおける動き表現を向上させることができるか?
  • RQ4TDD や iDT と比較して、提案されたプーリング戦略の正確性と効率性はどの程度か?

主な発見

  • 提案されたトラジェクトリープーリング戦略は、UCF101で93.78%の正確性を達成し、新たな最先端性能を樹立した。
  • ラインプーリング戦略は、UCF101で90.55%の正確性を達成し、TDD(90.3%)と同等の性能を示し、元のTwo-Stream ConvNets(88.0%)を上回った。
  • HMDB51では65.62%の正確性を達成し、元のTwo-Stream ConvNets(59.4%)を上回り、TDD(63.2%)と同等の性能を示した。
  • TDDと比較して、トラジェクトリープーリングは2%以上の性能向上を達成し、層選択およびプーリング設計の有効性を示した。
  • フレーム差分層とより深い畳み込み特徴の統合により、動き表現と全体の正確性が顕著に向上した。
  • UCF101ではiDTベースの手法を5%、HMDB51では4%上回り、深層学習の優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。