Skip to main content
QUICK REVIEW

[論文レビュー] Human Activity Recognition Using Tools of Convolutional Neural Networks: A State of the Art Review, Data Sets, Challenges and Future Prospects

Md. Milon Islam, Sheikh Nooruddin|arXiv (Cornell University)|Feb 2, 2022
Context-Aware Activity Recognition Systems被引用数 10
ひとこと要約

本論文は、スマートフォン、レーダー、ビジョン、マルチモーダルセンサーを用いた畳み込みニューラルネットワーク(CNN)ベースの人体活動認識(HAR)システムについて、包括的な最新状況レビューを提供している。CNNアーキテクチャの性能、ハイパーパrameter、データセットを評価し、主な課題を特定し、HARアプリケーションにおける今後の研究方向性を提示している。

ABSTRACT

Human Activity Recognition (HAR) plays a significant role in the everyday life of people because of its ability to learn extensive high-level information about human activity from wearable or stationary devices. A substantial amount of research has been conducted on HAR and numerous approaches based on deep learning and machine learning have been exploited by the research community to classify human activities. The main goal of this review is to summarize recent works based on a wide range of deep neural networks architecture, namely convolutional neural networks (CNNs) for human activity recognition. The reviewed systems are clustered into four categories depending on the use of input devices like multimodal sensing devices, smartphones, radar, and vision devices. This review describes the performances, strengths, weaknesses, and the used hyperparameters of CNN architectures for each reviewed system with an overview of available public data sources. In addition, a discussion with the current challenges to CNN-based HAR systems is presented. Finally, this review is concluded with some potential future directions that would be of great assistance for the researchers who would like to contribute to this field.

研究の動機と目的

  • 多様な入力モダリティを対象とした最近のCNNベースの人体活動認識(HAR)アプローチについて、体系的なレビューを提供すること。
  • HARに用いられるさまざまなCNNアーキテクチャの性能、長所・短所、ハイパーパrameterを分析・比較すること。
  • 現在の研究で用いられている公開可能なHARデータセットをリスト化・評価すること。
  • 一般化、データの不均衡、リアルタイムデプロイメントなどの、CNNベースのHARシステムにおける継続的な課題を特定し、議論すること。
  • 深層学習を活用した、堅牢で効率的かつスケーラブルなHARソリューションを進歩させるための今後の研究方向性を提示すること。

提案手法

  • マルチモーダルセンシングデバイス、スマートフォン、レーダー、ビジョンベースのシステムの4つの入力モダリティに分類してHARシステムを分類すること。
  • 各カテゴリで用いられるCNNアーキテクチャの体系的分析(ネットワークの深さ、フィルターサイズ、活性化関数、最適化手法を含む)。
  • ベンチマークデータセットを用いた標準的な指標(正確性、F1スコア、精度・再現率など)を用いてモデルのパフォーマンスを評価すること。
  • 14の公開可能なHARデータセットの収集と記述(センサータイプ、サンプリングレート、アクティビティクラスを含む)。
  • レビュー対象の論文で共通して用いられるハイパーパramータ設定(例:学習率、バッチサイズ)の特定。
  • 実世界でのデプロイメントにおける課題の統合的分析(ドメインシフト、センサーバリエーション、モデルの解釈可能性など)。

実験結果

リサーチクエスチョン

  • RQ1どのCNNアーキテクチャが、異なるHAR入力モダリティにおいて最高の正確性と耐性を示すか?
  • RQ2ハイパーパramータの選択(例:学習率、バッチサイズ)は、HARタスクにおけるCNNのパフォーマンスにどのように影響するか?
  • RQ3最も広く使われており、公開可能なHARデータセットは何か? それらの特徴は、モデルのパフォーマンスにどのように影響するか?
  • RQ4実世界環境におけるCNNベースのHARシステムのデプロイメントを妨げる主な技術的・実用的課題は何か?
  • RQ5CNNベースのHARモデルの一般化性、効率性、解釈可能性を向上させるために、今後最も有望な研究方向性は何か?

主な発見

  • UCLやUniMIBといったベンチマークデータセットでは、CNNベースのHARシステムが95%以上の正確性を達成しており、ResNet や DenseNet といった深層アーキテクチャが単純なモデルを上回っている。
  • スマートフォンベースのHARシステムは、加速度計やジャイロスコープからの豊富で高解像度のセンサデータのおかげで、一貫して高いパフォーマンス(95–98%の正確性)を示している。
  • レーダー基盤のHARシステムは、プライバシー保護が可能な環境で有望であるが、複雑な運動条件下での正確性に課題を抱えている。
  • ビジョンベースのHARシステムは高い正確性(最大97%)を達成しているが、大規模な計算リソースを要し、照明条件や遮蔽に敏感である。
  • インertシャルセンサとビジョンデータを統合するマルチモーダル融合アプローチは、特に困難な状況下で耐性と正確性を向上させている。
  • 標準データセットでは高いパフォーマンスを示しているものの、未観測の被験者や環境への一般化は、あらゆるモダリティにおいて依然として主要な制限要因である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。