Skip to main content
QUICK REVIEW

[論文レビュー] Augmenting Vision-Based Human Pose Estimation with Rotation Matrix

Milad Vazan, Fatemeh Sadat Masoumi|arXiv (Cornell University)|Oct 9, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

本稿では、ジム活動の監視を目的とした視覚ベースの人体ポーズ推定における物理的活動分類の精度を向上させるため、回転行列に基づくデータ拡張技術を提案する。1台のカメラ入力から回転行列を用いて360°の視点変化を生成することで、ポーズデータの多様性が向上し、SVM-SGDを用いた分類で5つのフィットネス活動において96%の精度を達成した。これは、拡張なしのベースラインの64%と比べ顕著に優れている。

ABSTRACT

Fitness applications are commonly used to monitor activities within the gym, but they often fail to automatically track indoor activities inside the gym. This study proposes a model that utilizes pose estimation combined with a novel data augmentation method, i.e., rotation matrix. We aim to enhance the classification accuracy of activity recognition based on pose estimation data. Through our experiments, we experiment with different classification algorithms along with image augmentation approaches. Our findings demonstrate that the SVM with SGD optimization, using data augmentation with the Rotation Matrix, yields the most accurate results, achieving a 96% accuracy rate in classifying five physical activities. Conversely, without implementing the data augmentation techniques, the baseline accuracy remains at a modest 64%.

研究の動機と目的

  • フィットネス応用における視覚ベースの人体活動認識(HAR)において、限られた単一視点ラベル付きデータの課題に対処すること。
  • 固定されたカメラアングルとマルチピアーストレーニングサンプルの不足によって引き起こされるポーズ推定の曖昧性を克服すること。
  • ビデオストリームから得られるポーズキーポイントデータを用いて、物理的活動の分類精度を向上させること。
  • ポーズ推定特徴量に対する回転行列ベースのデータ拡張の有効性を評価すること。
  • マルチクラスのフィットネス活動認識において、最適なポーズ推定モデル、データ拡張法、分類器の組み合わせを特定すること。

提案手法

  • 単一視点のビデオフレームからの正確な2次元人体キーポイント検出にBlazePoseを採用する。
  • 各元のポーズから180°時計回りおよび反時計回りの方向に合成トレーニングサンプルを生成するために回転行列変換を適用する。
  • 回転行列を用いて多様なカメラの視点をシミュレートし、追加のデータ収集なしにデータの多様性を向上させる。
  • 拡張ありおよびなしのキーポイントデータに対して、複数の機械学習分類器(例:SVM-SGD、ロジスティック回帰、KNN)をトレーニングし、比較する。
  • 分類精度の向上を図るために、冗長またはノイズの多いキーポイント特徴(例:右肩)を意図的に除外することでモデル性能を最適化する。
  • 限られたが代表的なジムエクササイズのデータセットを用いて、5クラスの物理的活動分類の性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1回転行列ベースのデータ拡張は、ポーズベースの人体活動認識モデルの汎化性能と精度を向上させることができるか?
  • RQ2回転行列を用いた合成マルチピアスビューの導入は、キーポイントデータに対するさまざまな分類アルゴリズムの性能にどのように影響するか?
  • RQ3回転拡張特徴を用いた5つの異なる物理的活動を分類する際、どの機械学習分類器が最も高い精度を達成するか?
  • RQ4特定の身体キーポイント特徴(例:右肩)を削除することで、ノイズや冗長性を低減し、分類性能が向上するか?
  • RQ5本手法は、精度とデータ効率の観点から、最先端のHARモデルと比較してどのように評価されるか?

主な発見

  • SVM-SGD最適化を用いたSVMが、回転行列ベースのデータ拡張と組み合わせた場合、最高の分類精度96%を達成した。
  • データ拡張なしでは、活動分類のベースライン精度はたったの64%にとどまり、拡張の重要性が顕著に示された。
  • 12キーポイントのポーズ表現から右肩キーポイントを除外することで、SVM-SGDの性能が向上し、11キーポイント特徴を用いて96%の精度を達成した。
  • 回転行列拡張法により、1つの元のサンプルに対して360°の合成ビューが生成され、1台のカメラからの情報のみでマルチピアスのトレーニングデータを効果的にシミュレートした。
  • 全評価分類器の中で、SVM-SGDは異なるキーポイント設定および拡張戦略において、最も一貫性があり優れた性能を示した。
  • 本手法は、極めて少ないトレーニングサンプル数で5つのフィットネス活動において96%の精度を達成し、従来の手法が大幅に多くのデータを必要としていたのと比べ顕著に優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。