Skip to main content
QUICK REVIEW

[論文レビュー] Video Representation Learning Using Discriminative Pooling

Jue Wang, Anoop Cherian|arXiv (Cornell University)|Mar 26, 2018
Human Pose and Action Recognition参考文献 45被引用数 18
ひとこと要約

本論文は、判別的クリップレベル特徴量とバックグラウンドノイズを分離する学習されたSVMベースの超平面を用いる、新しい動画表現学習手法である判別的プーリングを提案する。この手法により、ロバストでエンド・ツー・エンドで訓練可能な動画レベル表現が実現される。本手法は、HMDB-51、Charades、NTU-RGBDの各データセットにおいて、先行するプーリング手法よりも1–4%の精度向上を達成し、最先端の性能を示した。

ABSTRACT

Popular deep models for action recognition in videos generate independent predictions for short clips, which are then pooled heuristically to assign an action label to the full video segment. As not all frames may characterize the underlying action---indeed, many are common across multiple actions---pooling schemes that impose equal importance on all frames might be unfavorable. In an attempt to tackle this problem, we propose discriminative pooling, based on the notion that among the deep features generated on all short clips, there is at least one that characterizes the action. To this end, we learn a (nonlinear) hyperplane that separates this unknown, yet discriminative, feature from the rest. Applying multiple instance learning in a large-margin setup, we use the parameters of this separating hyperplane as a descriptor for the full video segment. Since these parameters are directly related to the support vectors in a max-margin framework, they serve as robust representations for pooling of the features. We formulate a joint objective and an efficient solver that learns these hyperplanes per video and the corresponding action classifiers over the hyperplanes. Our pooling scheme is end-to-end trainable within a deep framework. We report results from experiments on three benchmark datasets spanning a variety of challenges and demonstrate state-of-the-art performance across these tasks.

研究の動機と目的

  • 平均プーリングや最大プーリングなどのヒューリスティックなプーリング手法が、判別性の有無に関係なくすべてのクリップレベル予測を同等に扱うという限界を解消すること。
  • 真の行動を特徴付ける最も情報量の多いクリップレベル特徴量を特定・強調することで、動画表現学習を向上させること。
  • 判別的特徴量とバックグラウンドまたはノイズの特徴量を分離することを目的とする、複数インスタンス学習(MIL)問題としての動画プーリングの定式化。
  • 判別的超平面と行動分類器を同時に最適化するエンド・ツー・エンドで訓練可能なフレームワークの開発。
  • 行動認識、予測、検出、スケルトンベースの行動認識を含む、多様な動画理解ベンチマークにおける優れた性能を実証すること。

提案手法

  • 本手法は、動画シーケンスを「バッグ」としてモデル化し、ポジティブバッグには動画の特徴量、ネガティブバッグにはバックグラウンドまたはノイズのフレームの特徴量を含める。
  • 非線形SVMを用いて、最も判別的な特徴量とそれ以外を分離する大マージン二値分類問題を定式化し、超平面パラメータを動画レベル記述子として用いる。
  • 判別的超平面(SVMP記述子)と最終的な行動分類器を同時に学習するための共同最適化目的関数を採用し、エンド・ツー・エンドで訓練可能にする。
  • 深層畳み込みニューラルネットワーク(CNN)特徴量と、手作業で作成された特徴量(例:IDT-FV)の両方をサポートしており、広範な適用性を有する。
  • 非線形意思決定境界を実現するため、カーネル化されたSVMを採用し、計算効率を損なわずに判別力を向上させる。
  • 既存のCNNアーキテクチャに統合するため、グローバル平均プーリング層をSVMP層に置き換えることで、完全なエンド・ツー・エンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1情報量の多いクリップレベル特徴量と情報量の少ない特徴量を分離する学習された分離超平面を備えた判別的プーリング機構は、動画表現学習を向上させ得るか?
  • RQ2平均プーリング、最大プーリング、ランクプーリングと比較して、本手法のSVMベースのプーリング方式は、多様な動画理解タスクにおいて、ロバスト性と精度の点で優れているか?
  • RQ3本手法は、深層CNN特徴量と手作業特徴量の両方、および異なる動画データセットに対して、どの程度一般化可能か?
  • RQ4SVMP記述子と行動分類器の共同学習は、プーリングと分類の別々の訓練よりも、より優れた性能を達成できるか?
  • RQ5再訓練なしに、I3Dなどの事前学習モデルに適用した場合でも、本手法は強力な性能を維持できるか?

主な発見

  • HMDB-51では、ResNet + IDT特徴量を用いた本手法のSVMPは72.6%の精度を達成し、前回の最先端手法を1.3%上回った。
  • Charadesデータセットでは、分類タスクで26.7%のmAP、検出タスクで14.2%のmAPを達成し、次に優れた手法をそれぞれ4.3%、3.0%上回った。
  • NTU-RGBDでは、クロスサブジェクト精度が78.5%、クロスビュー精度が86.4%に向上し、最良のベースラインをそれぞれ4.2%、3.3%上回った。
  • I3D+モデルを用いたHMDB-51では、81.3%の精度を達成し、元のI3D+モデル(80.9%)を0.4%上回ったが、追加データは使用しなかった。
  • t-SNE可視化により、SVMPは平均プーリングや最大プーリングよりも、より判別性が高く、より明確に分離された特徴クラスタを生成することが確認された。
  • 広範なアブレーション実験により、本手法はすべてのデータセットおよび特徴タイプにおいて一貫して性能向上を示し、強力な一般化性とロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。