Skip to main content
QUICK REVIEW

[論文レビュー] ViT-ReT: Vision and Recurrent Transformer Neural Networks for Human Activity Recognition in Videos

James Wensel, Hayat Ullah|arXiv (Cornell University)|Aug 16, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、視覚変換器(ViT)を用いた空間的特徴抽出と、再帰的変換器(ReT)を用いた時系列シーケンスモデリングを組み合わせた新規ハイブリッドニューラルネットワーク、ViT-ReTを提案する。この手法は、CNN-RNNモデルと同等の精度を達成するが、顕著に高速な推論と低いメモリ使用量を実現し、リアルタイムおよびエッジ対応のアクティビティ認識システムにおける変換器の効率的でスケーラブルな代替手法の可能性を示している。

ABSTRACT

Human activity recognition is an emerging and important area in computer vision which seeks to determine the activity an individual or group of individuals are performing. The applications of this field ranges from generating highlight videos in sports, to intelligent surveillance and gesture recognition. Most activity recognition systems rely on a combination of convolutional neural networks (CNNs) to perform feature extraction from the data and recurrent neural networks (RNNs) to determine the time dependent nature of the data. This paper proposes and designs two transformer neural networks for human activity recognition: a recurrent transformer (ReT), a specialized neural network used to make predictions on sequences of data, as well as a vision transformer (ViT), a transformer optimized for extracting salient features from images, to improve speed and scalability of activity recognition. We have provided an extensive comparison of the proposed transformer neural networks with the contemporary CNN and RNN-based human activity recognition models in terms of speed and accuracy.

研究の動機と目的

  • 現在のCNN-RNNモデルが人間のアクティビティ認識において抱える限界、特に高い計算複雑性と遅い推論時間に対処すること。
  • 動画ベースのアクティビティ認識において、深層残差CNNやRNNの代替として軽量でスケーラブルな変換器ニューラルネットワーク(TNNs)の可能性を検討すること。
  • ViTとReTの組み合わせが、動画アクティビティ認識タスクにおける正確性、速度、メモリ効率の観点で、どの程度の性能を示すかを評価すること。
  • TNNベースのモデルがリソース制限のあるエッジデバイスやIoTデバイスに実装可能であることを実証すること、特にリアルタイム応用に適していること。

提案手法

  • モデルは、画像フレームをパッチに分割し、学習可能な位置埋め込みと多頭注目機構を適用することで、視覚変換器(ViT)を用いて各フレームの空間的特徴を抽出する。
  • 再帰的変換器(ReT)は、時系列フレームの間の依存関係をモデリングするために用いられ、自己注意メカニズムにより長距離の時系列的関係を捉える。
  • ViTとReTのコンポONENTは直列にスタックされる:ViTは各フレームを独立して処理し、ReTは得られた特徴のシーケンスを処理して最終予測を行う。
  • 標準的な交差エントロピー損失を用いてエンドツーエンドで訓練され、Adamや類似の最適化手法によるバックプロパゲーションで最適化される。
  • ResNetで用いられる重い残差接続や複雑な階層的特徴学習を避けており、代わりに注目に基づく特徴集約に依存している。
  • 推論速度、メモリ消費量、パラメータ数を用いてモデルの効率性を評価し、標準的なCNN-RNNベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1視覚変換器(ViT)は、人間のアクティビティ認識のための動画フレームから空間的特徴を効果的に抽出できるか?CNNベースの特徴抽出器を上回るか、同等の性能を発揮するか?
  • RQ2再帰的変換器(ReT)は、LSTM や GRU といった従来のRNNと比較して、動画シーケンス内の時系列的依存関係をより効率的に捉えることができるか?
  • RQ3ViTとReTの組み合わせにより、CNN-RNNパイプラインと比較して、顕著に高速な推論速度と低いメモリ使用量を実現しながらも、高い正確性を維持できるモデルが得られるか?
  • RQ4TNNsは、エンドツーエンドの人間のアクティビティ認識システムにおいて、従来のCNNおよびRNNコンponentをどの程度まで代替可能か?

主な発見

  • ReTモデルは、従来のRNNベースの分類器と同等の正確性を達成しながらも、より高速でメモリ効率が高く、アクティビティ認識における順序モデリングに変換器が実用的であることを示している。
  • ViT-ReTパイプラインは、従来のCNN-RNNモデルに比べて推論速度とメモリ効率で顕著に優れており、エッジデバイスやIoTデバイスへのデプロイに適している。
  • ViTによる空間的特徴抽出とReTによる時系列モデリングの組み合わせにより、従来の深層CNNとRNNのスタックに比べ、よりスケーラブルで並列処理が可能なアーキテクチャが実現できる。
  • 複雑な残差CNNやRNNを置き換えても、提案されたモデルは高い正確性を維持しており、自己注意メカニズムが動画理解における階層的特徴学習を効果的に代替できることを示唆している。
  • 結果から、TNNsは特にリアルタイムおよびリソース制限のある環境において、CNN-RNNパイプラインの強力な代替手段である可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。