Skip to main content
QUICK REVIEW

[論文レビュー] ReHAR: Robust and Efficient Human Activity Recognition

Xin Li, Mooi Choo Chuah|arXiv (Cornell University)|Feb 27, 2018
Human Pose and Action Recognition参考文献 33被引用数 7
ひとこと要約

ReHAR は、単一フレーム表現モデルと LSTM を組み合わせたエンド・ツー・エンド学習を実行する、頑健で効率的な人体活動認識フレームワークである。単一者およびグループ活動のデータセットの両方で最先端の精度を達成するとともに、従来の手法と比較して1桁以上高速に動作する。

ABSTRACT

Designing a scheme that can achieve a good performance in predicting single person activities and group activities is a challenging task. In this paper, we propose a novel robust and efficient human activity recognition scheme called ReHAR, which can be used to handle single person activities and group activities prediction. First, we generate an optical flow image for each video frame. Then, both video frames and their corresponding optical flow images are fed into a Single Frame Representation Model to generate representations. Finally, an LSTM is used to pre- dict the final activities based on the generated representations. The whole model is trained end-to-end to allow meaningful representations to be generated for the final activity recognition. We evaluate ReHAR using two well-known datasets: the NCAA Basketball Dataset and the UCFSports Action Dataset. The experimental results show that the pro- posed ReHAR achieves a higher activity recognition accuracy with an order of magnitude shorter computation time compared to the state-of-the-art methods.

研究の動機と目的

  • スポーツ動画における複雑な活動、特にグループ活動を処理できる人体活動認識システムの設計。
  • 既存のディープラーニング手法と比較して、認識精度を向上させるとともに、計算時間を大幅に短縮すること。
  • 動画と動きの表現の両方における意味のある特徴抽出を可能にするエンド・ツー・エンド学習の実現。
  • 入力フレームおよび光学フロー画像における重要な領域を可視化することで、視覚的解釈可能性を提供すること。

提案手法

  • 各動画フレームに対して光学フロー画像を生成し、動きのダイナミクスを捉える。
  • 生の動画フレームと対応する光学フロー画像を、スパatiotemporal特徴を抽出する「単一フレーム表現モデル」に供給する。
  • 得られた表現を処理するため、長期短期記憶(LSTM)ネットワークを用いて時間的依存性をモデル化し、最終的な活動ラベルを予測する。
  • 全モデルをエンド・ツー・エンドで訓練することで、活動認識に最適化された特徴表現を最適化する。
  • アブレーションスタディにより、次元削減と一般化性能の向上の両面でグローバル平均プーリング層の有効性が確認された。
  • 勾配ベースの可視化を用いてクラス固有のサリエンシーマップを生成し、モデルの注目領域と入力データの重要な部分を特定する。

実験結果

リサーチクエスチョン

  • RQ1統合されたディープラーニングフレームワークは、動画における単一者およびグループ活動を効果的に認識できるか?
  • RQ2動画フレームのみを使用する場合と比較して、光学フローとフレームの統合は認識精度をどのように向上させるか?
  • RQ3エンド・ツー・エンド学習は、複雑な活動認識における特徴表現の質をどの程度向上させるか?
  • RQ4従来の階層的またはエンド・ツー・エンドでないアプローチと比較して、本モデルは顕著に短い推論時間で高い精度を達成できるか?
  • RQ5予測時にモデルはどのような視覚的手がかりに注目しており、それらは人間の重要な動作認識とどの程度一致するか?

主な発見

  • ReHAR は、NCAAバスケットボールおよびUCFSportsアクションデータセットの両方で、最先端の手法と比較して高い活動認識精度を達成した。
  • 本モデルは、既存の手法と比較して約1桁の高速化を達成しており、リアルタイム応用に適している。
  • アブレーションスタディの結果、グローバルプーリング層をフラット化層に置き換えるとmAPが0.928から0.889に低下し、グローバルプーリングの性能への重要性が裏付けられた。
  • 可視化結果から、ReHAR は背景要因ではなく、選手、ボール、ゴールネットなど重要なアクターと動きのパターンに注目していることが明らかになった。
  • 誤分類例(例:「歩行」を「ゴルフ」と予測)では、人物とゴルフクラブなどの文脈的に関連する特徴が強調され、信頼性の高い誤りの根拠が示された。
  • 可視化手法により、クラス固有の重要度が2つのLSTMおよび全結合層をたどって追跡可能となり、モデルの意思決定の解釈可能性が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。