Skip to main content
QUICK REVIEW

[論文レビュー] Learning Gating ConvNet for Two-Stream based Methods in Action Recognition

Jiagang Zhu, Wei Zou|arXiv (Cornell University)|Sep 12, 2017
Human Pose and Action Recognition参考文献 11被引用数 5
ひとこと要約

本論文は、固定平均化の代わりにReLU活性化を用いた学習可能な融合重みを用いる、エンド・ツー・エンドで学習可能なゲーティングConvNetを提案する。マルチタスク学習により融合重みとアクション分類を同時に最適化することで、UCF101で94.5%の精度を達成し、固定重み手法を上回る。動的に信頼性の高い動画ごとのストリームに高い信頼度を割り当てることで、より適応的である。

ABSTRACT

For the two-stream style methods in action recognition, fusing the two streams' predictions is always by the weighted averaging scheme. This fusion method with fixed weights lacks of pertinence to different action videos and always needs trial and error on the validation set. In order to enhance the adaptability of two-stream ConvNets and improve its performance, an end-to-end trainable gated fusion method, namely gating ConvNet, for the two-stream ConvNets is proposed in this paper based on the MoE (Mixture of Experts) theory. The gating ConvNet takes the combination of feature maps from the same layer of the spatial and the temporal nets as input and adopts ReLU (Rectified Linear Unit) as the gating output activation function. To reduce the over-fitting of gating ConvNet caused by the redundancy of parameters, a new multi-task learning method is designed, which jointly learns the gating fusion weights for the two streams and learns the gating ConvNet for action classification. With our gated fusion method and multi-task learning approach, a high accuracy of 94.5% is achieved on the dataset UCF101.

研究の動機と目的

  • 二ストリームConvNetにおける固定重み融合の限界に対処する。これは、動画間で変化する空間的・時間的コンテンツに適応できない。
  • 入力特徴に基づくインスタンス固有の融合重みを学習することで、モデルの適応性を向上させる。
  • 融合重みとアクション分類を同時に最適化する新しいマルチタスク学習戦略を用いて、ゲーティングネットワークの過学習を低減する。
  • ゲーティング機構のエンド・ツー・エンド学習を可能にすることで、アクション認識ベンチマークにおける汎化性能と性能を向上させる。

提案手法

  • 空間的および時間的ストリームの同じレイヤーからの特徴マップを連結したものを入力とするゲーティングConvNetを導入する。
  • 空間的および時間的ストリームの非負の融合重みを生成するために、出力活性化関数としてReLUを用いる。
  • 融合重みとアクション分類の両方を同時に学習するマルチタスク学習フレームワークを設計する。
  • ゲーティングConvNetを予測レベルに適用し、固定平均化の代わりに動的に学習された融合を各動画サンプルごとに実装する。
  • ゲーティングネットワークの入力として、連結と畳み込み融合の異なる構成を検討する。
  • 融合と分類の目的関数を統合して最適化する標準的なバックプロパゲーションを用いて、システム全体をエンド・ツー・エンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1ゲーティングネットワークを介して学習された適応的融合重みは、固定重み平均化を上回る二ストリームアクション認識性能を実現できるか?
  • RQ2ゲーティング出力活性化関数としてSoftmaxの代わりにReLUを用いることで、収束が速くなり、性能が向上するか?
  • RQ3融合重みとアクション分類の共同学習は、ゲーティングネットワークの汎化性能を向上させ、過学習を低減できるか?
  • RQ4学習された融合重みの分布は、異なる動画クラスや入力タイプでどのように変化するか?
  • RQ5本手法は、UCF101のような標準ベンチマークでトップ-1およびトップ-5精度をどの程度向上させるか?

主な発見

  • 提案されたゲーティング融合手法は、UCF101でトップ-1精度94.5%を達成し、固定重み平均化手法を上回る。
  • ゲーティングネットワークにReLUを用いることで、Softmaxベースのゲーティングと比較して収束が速く、最終的な精度も競争力を持つ。
  • マルチタスク学習により、融合重みの適応的選択領域が拡大され、より動的かつ文脈に適応した融合意思決定が可能になる。
  • t-SNE可視化により、アクション分類と同時に学習されたゲーティングConvNetの特徴が、より判別可能になることが確認された。
  • 片方のストリームが信頼性がない状況では、モデルがより正確なストリームに高い重みを割り当てることを学習し、予測の信頼性と正答率が向上する。
  • 固定融合重みを手動で設定するためのハイパーパramータチューニングや検証セットの試行を排除することで、ハイパーパramータの調整依存性が低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。