Skip to main content
QUICK REVIEW

[論文レビュー] The Best of Both Worlds: Combining Data-independent and Data-driven Approaches for Action Recognition

Zhenzhong Lan, Dezhong Yao|arXiv (Cornell University)|May 17, 2015
Human Pose and Action Recognition参考文献 31被引用数 6
ひとこと要約

本稿では、データに依存しない手作業特徴(IDT)と、データ駆動型の非教師あり学習であるスタックド畳み込み独立部分空間分析(ConvISA)を組み合わせたハイブリッド手法を提案する。IDTトラジェクトリーバリューム上で局所記述子(LOPおよびLOF)を学習し、それらを従来の特徴と訓練不要なマルチクラス再ランク付け(MIR)技術で統合することで、HMDB51、Hollywood2、UCF101の3つのベンチマークで最先端性能を達成した。HMDB51では平均59.4%、UCF101では88.0%の精度を記録した。

ABSTRACT

Motivated by the success of data-driven convolutional neural networks (CNNs) in object recognition on static images, researchers are working hard towards developing CNN equivalents for learning video features. However, learning video features globally has proven to be quite a challenge due to its high dimensionality, the lack of labelled data and the difficulty in processing large-scale video data. Therefore, we propose to leverage effective techniques from both data-driven and data-independent approaches to improve action recognition system. Our contribution is three-fold. First, we propose a two-stream Stacked Convolutional Independent Subspace Analysis (ConvISA) architecture to show that unsupervised learning methods can significantly boost the performance of traditional local features extracted from data-independent models. Second, we demonstrate that by learning on video volumes detected by Improved Dense Trajectory (IDT), we can seamlessly combine our novel local descriptors with hand-crafted descriptors. Thus we can utilize available feature enhancing techniques developed for hand-crafted descriptors. Finally, similar to multi-class classification framework in CNNs, we propose a training-free re-ranking technique that exploits the relationship among action classes to improve the overall performance. Our experimental results on four benchmark action recognition datasets show significantly improved performance.

研究の動機と目的

  • 動画学習における高次元性、限られたラベル付きデータ、計算コストの高さに起因する識別的動画特徴の学習の課題に対処すること。
  • 純粋にデータ駆動型のCNNが動画行動認識において抱える限界を、小規模で局所的な動画ボリュームにおける非教師あり学習を活用することで克服すること。
  • IDTで用いられる従来の手作業特徴(例:HOG、HOF)を、ConvISAで学習されたデータ駆動型記述子に置き換えることによる特徴の向上。
  • クラス間の関係性を活用する訓練不要なマルチクラス反復的再ランク付け(MIR)手法により分類性能を向上させること。

提案手法

  • 改良版密度トラジェクトリ(IDT)から得られる小規模な動画ボリューム上で、非教師ありに視覚的外観(LOP)および運動(LOF)記述子を学習する2ストリームスタックドConvISAアーキテクチャを提案する。
  • 完全な動画ではなく、トラジェクトリに従う動画ボリューム(ピクセルおよびオプティカルフロー)上で記述子を学習することで、次元削減と計算コストの低減を実現する。
  • 学習されたLOPおよびLOF記述子を、統一された特徴表現パイプライン内で従来の手作業特徴(例:HOG、HOF)と統合する。
  • クラス関係性をモデル化することで、追加の訓練を要せず平均平均精度(MAP)を向上させる訓練不要なマルチクラス反復的再ランク付け(MIR)手法を設計する。
  • MIRの結果と元のスコアを単純なスコア統合技術で融合し、最終的な分類精度を向上させる。
  • 弱教師あり学習で一般的なコストのかかるラベル付与や誤ったラベル割り当ての問題を回避するため、大規模な動画データ上で非教師あり事前学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1小規模な動画ボリューム上で非教師ありのデータ駆動型学習を実施することで、IDTに用いられるような従来の手作業特徴(例:HOG/HOF)の性能向上が図れるか?
  • RQ2データ駆動型記述子(LOP/LOF)と手作業特徴を統合することで、ベンチマークデータセット上での行動認識精度にどのような影響を与えるか?
  • RQ3MIRのような訓練不要な再ランク付け手法が、クラス間の関係性を効果的に活用し、行動認識における平均平均精度の向上に寄与できるか?
  • RQ4非教師あり特徴学習を用いた場合、あるデータセット(例:Hollywood2)で学習したモデルが、別のデータセット(例:HMDB51)にどの程度一般化可能か?
  • RQ5提案されたConvISAベースの記述子学習フレームワークにおいて、最適なパラメータ(例:ストライド、受容 field サイズ、記述子次元)は何か?

主な発見

  • スタックドConvISAを用いてIDTトラジェクトリーバリューム上で学習されたLOPおよびLOF記述子は、同じパイプライン内で用いられる従来の手作業特徴(HOG/HOF)を顕著に上回る性能を示した。
  • 本手法はHMDB51で59.4%の平均精度、UCF101で88.0%の精度を達成し、テストした4つのベンチマークデータセットすべてで最先端の結果を再現または上回った。
  • 空間的および時間的ストライドを大きく(例:16および5)することで、特徴の重複を低減し、性能が向上した。重複が最小限に抑えられることで、トレーニングおよび推論が高速化された。
  • 受容 field サイズが(16,5)のときが、性能と計算コストのバランスにおいて最適であり、より大きなフィールドサイズでは性能向上が見られなかった。
  • 記述子次元が200のときが、情報保持とノイズ低減の両面で最適なトレードオフを示し、先行研究の結果とも一致した。
  • Hollywood2で学習したモデルはHMDB51へも2%の性能低下で一般化でき、特に困難なデータセットで学習した場合に顕著な高いクロスデータセット転送性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。