Skip to main content
QUICK REVIEW

[論文レビュー] Video Action Recognition Via Neural Architecture Searching

Wei Peng, Xiaopeng Hong|arXiv (Cornell University)|Jul 10, 2019
Human Pose and Action Recognition参考文献 22被引用数 4
ひとこと要約

本論文は、空間的・時間的アーキテクチャを効率的に探索できる、連続的で微分可能な探索空間をもつ有向無閉路グラフ(DAG)としてモデル化された擬似3D演算子を用いた、動画行動認識のための最初のニューラルアーキテクチャ探索(NAS)フレームワークを提案する。この手法は、UCF101でわずか0.67Mパラメータで58.6%の精度を達成し、3D-ConvNet(79Mパラメータ)よりも7%高い精度を記録しているが、パラメータ数は約1%にまで削減されている。

ABSTRACT

Deep neural networks have achieved great success for video analysis and understanding. However, designing a high-performance neural architecture requires substantial efforts and expertise. In this paper, we make the first attempt to let algorithm automatically design neural networks for video action recognition tasks. Specifically, a spatio-temporal network is developed in a differentiable space modeled by a directed acyclic graph, thus a gradient-based strategy can be performed to search an optimal architecture. Nonetheless, it is computationally expensive, since the computational burden to evaluate each architecture candidate is still heavy. To alleviate this issue, we, for the video input, introduce a temporal segment approach to reduce the computational cost without losing global video information. For the architecture, we explore in an efficient search space by introducing pseudo 3D operators. Experiments show that, our architecture outperforms popular neural architectures, under the training from scratch protocol, on the challenging UCF101 dataset, surprisingly, with only around one percentage of parameters of its manual-design counterparts.

研究の動機と目的

  • 動画行動認識のための高性能な空間的・時間的ニューラルアーキテクチャの自動設計を実現し、熟練したエンジニアリングに依存するのを軽減すること。
  • 動画タスクにおけるNASの高い計算コストを、時間的セグメント戦略と効率的な擬似3D演算子の導入によって低減すること。
  • エンドツーエンドで微分可能であり、連続的な探索空間を用いることで勾配ベース最適化を可能にすること。
  • 顕著に小さなモデルサイズで、トレーニングからスクラッチのプロトコルにおいて最先端の性能を達成すること。

提案手法

  • 各エッジに候補演算子の集合が関連付けられた有向無閉路グラフ(DAG)として探索空間をモデル化し、演算子選択を学習可能なアーキテクチャパラメータαを用いて微分可能にする。
  • プロキシレスサーチ戦略を採用:共有重みを用いた浅いネットワークを訓練してアーキテクチャの性能を評価し、再訓練にかかるコストを回避する。
  • 計算量を削減しながらも、動画全体のコンテキストを保持するため、N_s=4セグメントおよび1セグメントあたりN_r=2のランダムクロップを用いたTSNに類似した入力処理スキームを導入する。
  • 空間的および時間的演算を分離することで効率性を実現する、探索空間に組み込まれた擬似3D演算子(例:深度可分畳み込み、拡張畳み込み)を採用する。
  • アーキテクチャパラメータαにソフトマックスを適用し、各ノードごとに上位2つの接続と、各接続に対して最も重要な演算子を選択し、離散的で最終的なアーキテクチャを構築する。
  • 深さ=6、入力解像度112×112、600エポックにわたるコサイン減衰学習率スケジュールを用いて、探索されたアーキテクチャからスクラッチで最終ネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルアーキテクチャ探索は、動画行動認識に効果的に適用可能であり、空間的・時間的アーキテクチャの自動設計を可能にするか?
  • RQ2性能を損なうことなく、動画モデルのNASにおける計算コストをどのように低減できるか?
  • RQ3擬似3D演算子を用いた微分可能で連続的な探索空間は、より少ないパラメータ数で手動設計のものよりも優れたアーキテクチャを生成できるか?
  • RQ4提案手法は、標準ベンチマークでスクラッチから訓練した場合、手動設計のモデルを上回る性能を示すか?

主な発見

  • 提案されたNAS手法は、UCF101スプリット1で58.6%のトップ1精度を達成し、3D-ConvNet(51.6%)を7ポイント上回っているが、パラメータ数はわずか0.67Mにとどまっている。
  • 探索されたアーキテクチャは3D-ConvNet(79Mパラメータ)の約1%のサイズにまで削減されており、顕著なモデルサイズの縮小と同時に顕著な精度向上を実現している。
  • トレーニングからスクラッチのプロトコルにおいて最先端の性能を達成しており、ImageNetの事前学習の必要性がなくなる。
  • 探索プロセスは単一のV100 GPUで25時間で完了し、実用的導入に適している。
  • 最終アーキテクチャは、拡張畳み込みや深度可分畳み込みなど、大きな感受野を持つ演算子を好む傾向を示しており、効果的なインダクティブバイアス学習が行われていることが示唆される。
  • 性能向上は複数の評価指標にわたり一貫しており、精度とパラメータ効率の両面で、3D-ResNet18、3D-ResNet101、STC-ResNetの変種を著しく上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。