Skip to main content
QUICK REVIEW

[論文レビュー] Pillar Networks++: Distributed non-parametric deep and wide networks

Biswa Sengupta, Qian Yu|ArXiv.org|Aug 18, 2017
Human Pose and Action Recognition参考文献 23被引用数 5
ひとこと要約

Pillar Networks++ は、複数の深層畳み込みニューラルネットワーク(Inception および ResNet)とガウス過程分類器を製品の専門家(PoE)アーキテクチャで統合した分散型で非パrametricな深層学習フレームワークを導入し、不確実性を考慮したスケーラブルな動画行動認識を実現した。手作業で作成した特徴量に依存せず、HMDB-51 データセットで 73.6% の最先端の正確度を達成し、先行手法より 1.4% 高い性能を発揮した。

ABSTRACT

In recent work, it was shown that combining multi-kernel based support vector machines (SVMs) can lead to near state-of-the-art performance on an action recognition dataset (HMDB-51 dataset). This was 0.4\% lower than frameworks that used hand-crafted features in addition to the deep convolutional feature extractors. In the present work, we show that combining distributed Gaussian Processes with multi-stream deep convolutional neural networks (CNN) alleviate the need to augment a neural network with hand-crafted features. In contrast to prior work, we treat each deep neural convolutional network as an expert wherein the individual predictions (and their respective uncertainties) are combined into a Product of Experts (PoE) framework.

研究の動機と目的

  • カメラのアングル、照明、動画品質の変動が大きい動画における行動認識の課題に対処すること。
  • 手作業で作成した特徴量に依存しないように、深層ニューラルネットワークと非パrametricベイジアンモデルを組み合わせること。
  • 分散型エキスパートネットワークを用いることで、動画分類における水平スケーラビリティを実現すること。
  • 製品の専門家(PoE)フレームワークを用いて、複数の深層ネットワークエキスパートからの不確実性推定値を統合することで、予測のロバスト性を向上させること。

提案手法

  • 各深層ニューラルネットワーク(Inception および ResNet)が独立したエキスパートとして機能し、RGB およびオプティカルフロー入力から空間的・時間的特徴量を抽出する。
  • 4 つのストリーム(2 つの Inception および 2 つの ResNet ネットワーク)からの特徴量が、分散型ガウス過程分類器を用いて統合される。
  • 製品の専門家(PoE)フレームワークが個々の予測とその不確実性を統合し、ロバスト性とキャリブレーションの向上を図る。
  • 分散型 GP の設定における推論にはラプラス近似が用いられ、標準の GPU ワークステーションでも効率的な計算が可能になる。
  • 追加のネットワークエキスパートをシステムに統合するだけで、再トレーニングなしに水平スケーリングが可能である。
  • 非パrametricベイジアンモデリングにより、少ないデータでも効果的な学習が可能となり、予測の平均値に加えて予測の不確実性も提供できる。

実験結果

リサーチクエスチョン

  • RQ1手作業で作成した特徴量に依存せず、分散型で非パrametricな深層ネットワークアンサンブルが、HMDB-51 動画認識ベンチマークで先行の最先端手法を上回ることができるか?
  • RQ2不確実性を考慮したガウス過程分類と複数の深層ネットワークエキスパートを統合することで、予測のロバスト性と正確度がどのように向上するか?
  • RQ3多様な深層ネットワーク出力の統合において、製品の専門家フレームワークが予測の過信をどの程度軽減できるか?
  • RQ4分散型ガウス過程が、再トレーニングなしに新しいネットワークエキスパートを順次追加可能なスケーラブルでモジュラーな動画分類を可能にするか?
  • RQ5ベイジアン PoE フレームワークにおける不確実性を考慮したモデル平均化が、品質や視点、動きの変動が大きい困難な動画データにおける一般化性能をどのように向上させるか?

主な発見

  • Pillar Networks++ は、HMDB-51 データセットでトップ-1 正確度 73.6% を達成し、新たな最先端の性能を樹立した。
  • 手作業で作成した iDT 特徴量を用いた先行手法を含め、1.4 パcentポイントの優位性を示した。
  • Inception および ResNet ネットワークからの深層特徴量のみに依存することで、手作業で作成した特徴量の必要性を排除した。
  • PoE フレームワークによる不確実性推定値の統合により、多様な動画条件においてより信頼性が高くキャリブレーションされた予測が得られた。
  • 分散型 GP アーキテクチャにより水平スケーリングが可能となり、システム全体の再トレーニングなしに新たなネットワークエキスパートをモジュラーに追加できる。
  • 品質、視点、運動の変動が大きい困難な動画データに対しても、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。