Skip to main content
QUICK REVIEW

[論文レビュー] IMUTube: Automatic Extraction of Virtual on-body Accelerometry from Video for Human Activity Recognition

Hyeokhyen Kwon, Catherine Tong|arXiv (Cornell University)|May 29, 2020
Context-Aware Activity Recognition Systems参考文献 99被引用数 10
ひとこと要約

IMUTube は、コンピュータビジョンと信号処理を用いて YouTube ビデオから仮想的な身体装着型 IMU データを自動的に生成するパイプラインを提案する。これにより、大規模で多様性に富み、ラベルが付与された HAR データセットの作成が可能になる。本手法は、YouTube ビデオから現実的な運動データを合成することで、ベンチマークデータセット上での HAR モデル性能を顕著に向上させる。

ABSTRACT

The lack of large-scale, labeled data sets impedes progress in developing robust and generalized predictive models for on-body sensor-based human activity recognition (HAR). Labeled data in human activity recognition is scarce and hard to come by, as sensor data collection is expensive, and the annotation is time-consuming and error-prone. To address this problem, we introduce IMUTube, an automated processing pipeline that integrates existing computer vision and signal processing techniques to convert videos of human activity into virtual streams of IMU data. These virtual IMU streams represent accelerometry at a wide variety of locations on the human body. We show how the virtually-generated IMU data improves the performance of a variety of models on known HAR datasets. Our initial results are very promising, but the greater promise of this work lies in a collective approach by the computer vision, signal processing, and activity recognition communities to extend this work in ways that we outline. This should lead to on-body, sensor-based HAR becoming yet another success story in large-dataset breakthroughs in recognition.

研究の動機と目的

  • 人体活動認識(HAR)分野における大規模でラベル付きの身体装着型センサーデータの不足を、公開済みのビデオリポジトリを活用することで解決すること。
  • モデルの頑健性と一般化性能を阻害する、小規模で一般化できない HAR データセットの限界を克服すること。
  • ビデオから仮想的な身体装着型 IMU シグナルを抽出する自動フレームワークを構築し、複数の身体部位における実際の加速度計測を模倣すること。
  • 物理的センサーデータ収集を必要とせずに、HAR モデルのためのより大規模で多様な訓練データの作成を可能にすること。
  • 将来的な HAR 研究を促進するために、高コストで時間がかかる本物のセンサーデータ収集に代わるスケーラブルでデータ効率の良い代替手段を提供すること。

提案手法

  • 大規模なリポジトリ(例:YouTube)から得られるビデオデータを、運動データの主な入力ソースとして使用する。
  • 2次元キーポイント推定(例:MediaPipe Pose)を適用し、ビデオフレームからキーポイントの軌跡を抽出する。
  • 幾何学的および時間的モデリングを用いて2次元関節軌跡を3次元ボディキネマティクスにマッピングし、ボディセグメントの運動を推定する。
  • 信号処理技術を適用して、仮想的な身体装着型センサーロケーションに実際の3次元加速度信号を合成する。
  • データ拡張および正規化を実装し、仮想 IMU データを現実世界のセンサーデータ分布と一致させる。
  • 仮想 IMU データを標準的な HAR 訓練パイプラインに統合し、本物のデータセット上でモデル性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ビデオから生成された仮想 IMU データは、HAR タスクにおいて本物の IMU データと同等の性能を達成できるか?
  • RQ2ビデオデータに含まれる運動の多様性は、小規模な本物のデータセットと比較して、モデルの一般化性能をどの程度向上させるか?
  • RQ3仮想 IMU シグナルは、本物の加速度計測シグナルの時間的および空間的特性をどの程度正確に保持しているか?
  • RQ4仮想データ生成パイプラインは、大規模な HAR 研究をサポートするために自動化されスケーラブルか?
  • RQ5仮想データと本物のデータを組み合わせた場合、HAR モデルの精度と頑健性にどのような影響を与えるか?

主な発見

  • IMUTube は、本物の IMU シグナルと高い類似性を持つ、ビデオから仮想的な身体装着型加速度計測データを効果的に生成できた。
  • 仮想 IMU データは、標準ベンチマークデータセット上での HAR モデルの精度を向上させ、訓練用途における有効性を示した。
  • 本手法により、公開済みのビデオから大規模で多様なデータセットを構築できるようになった。これは、データ不足の問題を克服するものである。
  • 本物のデータを一切使用しない仮想データで訓練されたモデルも、顕著な性能向上を示した。特に、本物データと組み合わせた場合に顕著であった。
  • フレームワークは、ビデオ品質の変動、カメラアングル、被験者の外見の違いに対しても頑健であることが示され、実用的なスケーラビリティを示した。
  • 本手法により、高価な物理的データ収集に依存するのを減らすことで、データ効率の良い HAR 研究の新たな道筋が開かれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。