Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time Activity Recognition and Intention Recognition Using a Vision-based Embedded System

Sahar Darafsh, Saeed Shiry Ghidary|arXiv (Cornell University)|Jul 27, 2021
Video Surveillance and Tracking Methods参考文献 42被引用数 7
ひとこと要約

本稿では、速度および方向特徴で表現された動画データを分類する1つのAlexNet CNNを用いて、リアルタイムのビジョンベースの埋め込みシステムを提案し、独自の意図認識データセットで98.78%の精度を達成し、ベンチマークデータセットでは78.48–100%の精度を示し、FPGAベースのZCU102プラットフォームで120 fpsのリアルタイム性能を実現した。

ABSTRACT

With the rapid increase in digital technologies, most fields of study include recognition of human activity and intention recognition, which are essential in smart environments. In this study, we equipped the activity recognition system with the ability to recognize intentions by affecting the pace of movement of individuals in the representation of images. Using this technology in various environments such as elevators and automatic doors will lead to identifying those who intend to pass the automatic door from those who are passing by. This system, if applied in elevators and automatic doors, will save energy and increase efficiency. For this study, data preparation is applied to combine the spatial and temporal features with the help of digital image processing principles. Nevertheless, unlike previous studies, only one AlexNet neural network is used instead of two-stream convolutional neural networks. Our embedded system was implemented with an accuracy of 98.78% on our intention recognition dataset. We also examined our data representation approach on other datasets, including HMDB-51, KTH, and Weizmann, and obtained accuracy of 78.48%, 97.95%, and 100%, respectively. The image recognition and neural network models were simulated and implemented using Xilinx simulators for the Xilinx ZCU102 board. The operating frequency of this embedded system is 333 MHz, and it works in real-time with 120 frames per second (fps).

研究の動機と目的

  • エレベーターおよび自動ドアなどのスマート環境における人間の意図を認識する低コストでリアルタイムの埋め込みシステムの開発。
  • カメラの角度、照明、身体のポーズの変化に敏感である既存のビジョンベースのシステムの限界を克服すること。
  • 自動ドアやエレベーターが、利用を意図する者と単に通り過ぎる者を区別できるようにすることで、エネルギー効率を向上させること。
  • RGBデータや2ストリームCNNに依存しない運動速度および方向を捉える動画表現手法の設計。
  • FPGAプラットフォーム上でシステムを実装・検証し、リアルタイムで低消費電力な展開を実現すること。

提案手法

  • RGBデータを不要とし、カメラの角度依存性を低減するため、運動速度および方向特徴を用いた新しい動画表現手法を提案。
  • 2ストリームCNNではなく、1つのAlexNet畳み込みニューラルネットワークを用いて、処理済みの動画特徴から行動および意図を分類。
  • デジタル画像処理技術を用いて、動画シーケンスから空間的および時間的特徴を抽出し、動きのダイナミクスに焦点を当てる。
  • ZCU102 FPGAボード上で、333 MHzのクロック周波数でリアルタイム処理を実現するため、Xilinx Vivadoツールを用いてシステムのシミュレーションおよび合成を実施。
  • 低消費電力と高スループットを最適化し、120 fpsの処理能力を達成。
  • 異なる条件での耐性を評価するため、複数のデータセット(HMDB-51、KTH、Weizmann)を用いて手法を検証。

実験結果

リサーチクエスチョン

  • RQ1RGB入力なしで運動に基づく動画表現を用いた1つのCNNが、人間の行動と意図を効果的に認識できるか?
  • RQ2提案手法の運動特徴表現は、カメラの角度、照明、シーンの複雑さが異なる多様なデータセットでどのように性能を発揮するか?
  • RQ3低消費電力の埋め込みFPGAハードウェア上で、システムがリアルタイム性能と高い精度を維持できる範囲はどの程度か?
  • RQ4システムは、自動ドアやエレベーターを利用しようとしている者と単に通り過ぎる者を信頼性高く区別できるか?
  • RQ5精度および効率の観点から、既存の2ストリームCNNやハンドクラフト特徴ベースの手法と比較して、本手法の性能はどの程度か?

主な発見

  • 独自の意図認識データセットで98.78%の精度を達成し、意図ありと意図なしの行動を高精度で区別できることを示した。
  • HMDB-51データセットでは78.48%の精度を達成し、照明、ポーズ、カメラの角度の変化に対しても耐性があることを示した。
  • KTHデータセットでは97.95%の精度に達し、制御された良好なポーズの人体動作に対して優れた性能を示した。
  • Weizmannデータセットでは100%の精度を達成し、明確に定義された動きを認識する有効性を強力に示した。
  • ZCU102 FPGAボード上で120 fpsのリアルタイム動作を実現し、標準のUSBカメラの30 fps入力レートを上回った。
  • オンチップ消費電力は7.326 Wで、熱的マージンは67.8°Cであり、低消費電力で長期間運用可能なことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。