Skip to main content
QUICK REVIEW

[論文レビュー] Learning long-term dependencies for action recognition with a biologically-inspired deep network

Yemin Shi, Yonghong Tian|arXiv (Cornell University)|Nov 16, 2016
Human Pose and Action Recognition参考文献 52被引用数 5
ひとこと要約

本論文では、フィードフォワードおよびフィードバック接続を持つループ構造で共有されるプロセッサを導入することで、脳の構造を模倣した生物的インスピレーションを受けて考案されたshuttleNetを提案する。CNN-RNNフレームワークにshuttleNetを統合することで、パラメータ数が同程度の他の手法と比較して、UCF101(95.4%)およびHMDB51(71.7%)で最先端の性能を達成した。

ABSTRACT

Despite a lot of research efforts devoted in recent years, how to efficiently learn long-term dependencies from sequences still remains a pretty challenging task. As one of the key models for sequence learning, recurrent neural network (RNN) and its variants such as long short term memory (LSTM) and gated recurrent unit (GRU) are still not powerful enough in practice. One possible reason is that they have only feedforward connections, which is different from the biological neural system that is typically composed of both feedforward and feedback connections. To address this problem, this paper proposes a biologically-inspired deep network, called shuttleNet\footnote{Our code is available at \url{https://github.com/shiyemin/shuttlenet}}. Technologically, the shuttleNet consists of several processors, each of which is a GRU while associated with multiple groups of cells and states. Unlike traditional RNNs, all processors inside shuttleNet are loop connected to mimic the brain's feedforward and feedback connections, in which they are shared across multiple pathways in the loop connection. Attention mechanism is then employed to select the best information flow pathway. Extensive experiments conducted on two benchmark datasets (i.e UCF101 and HMDB51) show that we can beat state-of-the-art methods by simply embedding shuttleNet into a CNN-RNN framework.

研究の動機と目的

  • 動画シーケンスにおける長期依存関係を学習する課題に対処すること。
  • 標準的なRNN、LSTM、GRUが生物的神経系に見られるフィードバック接続を欠いているという制限を克服すること。
  • 脳のフィードフォワードおよびフィードバック接続パターンを模倣した深層ネットワークアーキテクチャを設計すること。
  • ループ構造で複数のパスウェイにまたがってプロセッサを共有することにより、シーケンスモデリングの効率性と表現力の向上を図ること。
  • このような生物学的インスピレーションを受けて設計されたアーキテクチャが、同程度のパラメータ数を有する既存のRNNベースのモデルを上回ることを実証すること。

提案手法

  • shuttleNetは、N個のプロセッサがリング構造に配置されており、各プロセッサはゲート付き再帰ユニット(GRU)であり、ストライドKで接続されてループ構造を形成する。
  • 各プロセッサはD個のセルおよび状態のグループに関連付けられており、ループ内を複数の情報パスウェイが循環可能である。
  • ループ接続により、フィードフォワードおよびフィードバックの両方のパスウェイが生成され、情報が複数の時間ステップにわたり循環して処理可能となる。
  • ネットワークはN個のパスウェイを同時に処理し、各プロセッサは自らの状態を保持しながら、パスウェイ間で重みを共有する。
  • 注意メカニズムが適用され、最終的な予測に最も情報を含むパスウェイを動的に選択する。
  • アーキテクチャは、事前学習済みのCNN(例:Inception-ResNet-v2)から得られる特徴量をshuttleNetに供給するCNN-RNNフレームワークに統合される。

実験結果

リサーチクエスチョン

  • RQ1フィードフォワードおよびフィードバック接続を持つ生物学的インスピレーションを受けて設計された深層ネットワークは、行動認識における長期シーケンスモデリングを改善できるか?
  • RQ2ループ構造でプロセッサを共有するアーキテクチャは、標準的なRNNと比較して情報の流れや表現学習を向上させられるか?
  • RQ3このようなネットワークは、パラメータ数が同程度のLSTMやGRUを、ベンチマークとしての行動認識データセットで上回れるか?
  • RQ4注意メカニズムは、shuttleNetアーキテクチャにおける最適なパスウェイ選択にどのように寄与するか?
  • RQ5shuttleNetフレームワークは、HMDB51のような小規模なデータセットに効果的に適用可能か?また、ハンドクラフト特徴量とどのように相乗効果を生むか?

主な発見

  • shuttleNetはUCF101で95.4%の精度を達成し、以前の最先端手法(Three-stream TSN:94.2%)を上回り、二重ストリームConvNetと比較して7.4ポイントも優れている。
  • HMDB51では71.7%の精度を達成し、MIFS(65.1%)およびTSN(69.4%)を大きく上回り、小規模で困難なデータセットでも強力な性能を示した。
  • 2プロセッサ・2ステップのshuttleNetバージョンはUCF101で91.94%の精度を達成し、最小限の複雑さでループ構造の有効性を実証した。
  • Inception-ResNet-v2をベースネットワークとして使用すると、GoogLeNetに比べ2%の精度向上が得られ、shuttleNetがより強力なバックボーンと組み合わせてスケーラブルであることを示した。
  • MIFSとのラテナル融合によりHMDB51での性能が向上し、深層特徴量とハンドクラフト特徴量が相補的であることを確認した。
  • モデルの並列処理可能な設計により、各プロセッサが各時間ステップで独立して動作するため、計算が効率的であり、ハードウェア加速を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。