Skip to main content
QUICK REVIEW

[論文レビュー] Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition with CNNs

Lei Wang, Piotr Koniusz|arXiv (Cornell University)|Jun 13, 2019
Human Pose and Action Recognition参考文献 56被引用数 12
ひとこと要約

本論文は、RGB I3D特徴マップからImproved Dense Trajectory (IDT) Bag-of-Words (BoW) および Fisher Vector (FV) 特徴、さらには I3D 光学フロー特徴をエンド・ツー・エンドで学習可能なCNNフレームワークを提案し、高コストな事前処理ステップを排除する。この手法は4つのデータセットで最先端の行動認識性能を達成するとともに、計算コストを20–55時間削減する。

ABSTRACT

In this paper, we revive the use of old-fashioned handcrafted video representations for action recognition and put new life into these techniques via a CNN-based hallucination step. Despite of the use of RGB and optical flow frames, the I3D model (amongst others) thrives on combining its output with the Improved Dense Trajectory (IDT) and extracted with its low-level video descriptors encoded via Bag-of-Words (BoW) and Fisher Vectors (FV). Such a fusion of CNNs and handcrafted representations is time-consuming due to pre-processing, descriptor extraction, encoding and tuning parameters. Thus, we propose an end-to-end trainable network with streams which learn the IDT-based BoW/FV representations at the training stage and are simple to integrate with the I3D model. Specifically, each stream takes I3D feature maps ahead of the last 1D conv. layer and learns to `translate' these maps to BoW/FV representations. Thus, our model can hallucinate and use such synthesized BoW/FV representations at the testing stage. We show that even features of the entire I3D optical flow stream can be hallucinated thus simplifying the pipeline. Our model saves 20-55h of computations and yields state-of-the-art results on four publicly available datasets.

研究の動機と目的

  • 行動認識のためのハンドクラフトド動画表現パイプラインにおける高価なオフライン事前処理ステップの必要性を排除すること。
  • I3D特徴マップからIDTベースのBoWおよびFV記述子を学習するCNNスティームのエンド・ツー・エンド学習を可能にすること。
  • I3D光学フロー ストリームでさえもRGB ストリームからエンド・ツー・エンド学習によって想起できることを示すこと。
  • 合成されたグローバル記述子を通じて、認識精度を維持または向上させながら計算コストを削減すること。

提案手法

  • 最終の1次元畳み込みの前段階であるI3D特徴マップの上に、BoWおよびFV表現を生成するための専用CNNスティームを訓練する。
  • 訓練中に、真値のIDT特徴を用いてBoWおよびFV記述子の想起を監視するために、平均二乗誤差(MSE)損失を用いる。
  • BoWおよびFV特徴のバーストネスを軽減し、一般化性能を向上させるために、パワー正規化(PN)を適用する。
  • 複数のスティームを統合する際の過学習を防ぐために、カウンティングスケッチ投影を用いる。
  • 最終分類の前に、想起されたBoW、FV、およびハイレベルアブストラクション特徴(HAF)を元のI3D特徴と連結する。
  • 推論時においてはMSE損失を無効化し、真値の監視なしにテスト中に記述子を想起できるようにする。

実験結果

リサーチクエスチョン

  • RQ1CNNは、I3D特徴マップからハンドクラフトドIDTベースBoWおよびFV記述子を効果的に想起することができるか?
  • RQ2エンド・ツー・エンド学習により、I3D光学フロー ストリームはRGB ストリームからどの程度再構成可能か?
  • RQ3グローバル記述子を想起することで、認識精度を損なわず計算コストを削減できるか?
  • RQ4パワー正規化やカウンティングスケッチといった技術は、想起された特徴のロバスト性と性能にどのように影響するか?

主な発見

  • 提案手法は、IDT特徴をオフラインで抽出する標準パイプラインと比較して、計算コストを20–55時間削減した。
  • HMDB-51では、512pxのヒューマンセントリック前処理を用いた場合、78.5%の精度を達成し、256pxベースラインより1.3%向上した。
  • 複数のスケッチとパワー正規化を組み合わせたモデルは、MPIIで81.7%のmAPを達成し、ベースラインより3.9ポイント優れた性能を示した。
  • 想起されたBoWおよびFV記述子は真値特徴に近く、訓練時と推論時の誤差分布に最小限の乖離が見られた。
  • HMDB-51、UCF-101、Kinetics-400、MPIIの4つの公開データセットにおいて、本手法は最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。