Skip to main content
QUICK REVIEW

[論文レビュー] An IoT Based Framework For Activity Recognition Using Deep Learning Technique

Ashwin Geet d'Sa, Bhanu Prasad|arXiv (Cornell University)|Jun 17, 2019
Human Pose and Action Recognition参考文献 25被引用数 8
ひとこと要約

本論文は、背景差分法による前処理を施した3次元畳み込みニューラルネットワーク(3D-CNN)を用いた、IoT対応で低コストなアクティビティ認識フレームワークを提案する。本システムはラズベリー・パイからの動画ストリームを処理し、ポータブルなハードウェア上でリアルタイムに正確なアクティビティ分類を達成しており、医療、監視、HCIアプリケーションにおける実世界への展開可能性を示している。

ABSTRACT

Activity recognition is the ability to identify and recognize the action or goals of the agent. The agent can be any object or entity that performs action that has end goals. The agents can be a single agent performing the action or group of agents performing the actions or having some interaction. Human activity recognition has gained popularity due to its demands in many practical applications such as entertainment, healthcare, simulations and surveillance systems. Vision based activity recognition is gaining advantage as it does not require any human intervention or physical contact with humans. Moreover, there are set of cameras that are networked with the intention to track and recognize the activities of the agent. Traditional applications that were required to track or recognize human activities made use of wearable devices. However, such applications require physical contact of the person. To overcome such challenges, vision based activity recognition system can be used, which uses a camera to record the video and a processor that performs the task of recognition. The work is implemented in two stages. In the first stage, an approach for the Implementation of Activity recognition is proposed using background subtraction of images, followed by 3D- Convolutional Neural Networks. The impact of using Background subtraction prior to 3D-Convolutional Neural Networks has been reported. In the second stage, the work is further extended and implemented on Raspberry Pi, that can be used to record a stream of video, followed by recognizing the activity that was involved in the video. Thus, a proof-of-concept for activity recognition using small, IoT based device, is provided, which can enhance the system and extend its applications in various forms like, increase in portability, networking, and other capabilities of the device.

研究の動機と目的

  • リアルタイム監視を可能にする、IoT対応の低コストでポータブルなアクティビティ認識システムの開発。
  • 背景差分法を前処理ステップとして統合することで、3D-CNNに基づく人間のアクティビティ認識の精度を向上させること。
  • 高負荷なIoTデバイス(例:ラズベリー・パイ)にトレーニング済みの3D-CNNモデルを効果的にデプロイできるかを検証すること。
  • 医療、監視、ヒューマンコンピュータインタラクションの分野における、エッジデバイスでのリアルタイム動画処理と分類を可能にすること。
  • 低解像度の動画入力が計算負荷を軽減しながらも分類性能を維持できるかどうかを実証すること。

提案手法

  • 背景差分法を用いて動画フレームから静的背景を分離し、移動する前面オブジェクトを強調することで、後続処理の特徴抽出を向上させる。
  • 前処理済みの動画クリップ(8秒間の動画から35フレームを抽出)を3次元畳み込みニューラルネットワーク(3D-CNN)に供給し、空間的・時間的特徴を学習・分類する。
  • 3D-CNNモデルは、計算負荷が非常に高いトレーニングを考慮し、高性能システム上でKTHデータセットを用いて学習を行う。
  • トレーニング済みのモデル重みは、処理能力に制限があるため、デバイス内でのトレーニングを避けるためにラズベリー・パイに移行する。
  • ラズベリー・パイのカメラモジュールを用いて160×120解像度で動画をキャプチャし、トレーニングデータの次元と整合性を保つためのフレームサンプリングを実施する。
  • 分類後の出力を、IoTプロトコル(例:GSMによるSMS、SMTPによるメール)を介して送信し、リアルタイムのアラート発行やアクチュエータ制御を可能にする。

実験結果

リサーチクエスチョン

  • RQ1背景差分法による前処理を施した場合、生の動画フレームを直接3D-CNNに使用する場合と比較して、3D-CNNに基づく人間のアクティビティ認識の精度が向上するか?
  • RQ2高性能なハードウェア上で学習された3D-CNNモデルを、ラズベリー・パイのような低消費電力のIoTデバイスに効果的にデプロイでき、信頼性のある推論を達成できるか?
  • RQ3エッジベースのアクティビティ認識において、計算効率と分類精度のトレードオフに与える動画解像度の影響はどの程度か?
  • RQ4静的背景を有する実世界の屋内環境において、ポータブルでIoT対応のシステムが、リアルタイム性能と精度をどの程度維持できるか?
  • RQ5計算リソースが制限されたエッジデバイスにディープラーニングモデルをデプロイする際の実用的限界は何か?

主な発見

  • 背景差分法による前処理は、3D-CNNに生の動画フレームを直接入力する場合と比較して、分類精度を顕著に向上させた。
  • 本システムは、ラズベリー・パイの内蔵カメラモジュールからキャプチャした動画を用いて、エッジデバイス上で正確なアクティビティ分類を達成した。これにより、エッジデバイスへのリアルタイムデプロイの可能性が裏付けられた。
  • 160×120解像度の低解像度動画入力が、正確な分類を維持するのに十分であり、計算負荷を軽減した。これにより、デバイス内での推論が実現可能となった。
  • ラズベリー・パイ上でのモデル推論は、トレーニングに使用したシステムよりも遅かったが、主に処理能力の制限に起因するものであり、リアルタイムアプリケーションに耐える機能を維持していた。
  • 高性能システムからラズベリー・パイに事前学習済みのモデル重みを移行することで、デバイス内でのトレーニングを回避しつつ、効果的なデプロイが可能となった。
  • 本フレームワークは、GSMやSMTPなどのIoT通信プロトコルとの統合をサポートしており、監視や医療分野におけるリアルタイムアラート発行やアクチュエータ制御を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。