[論文レビュー] Posture and sequence recognition for Bharatanatyam dance performances using machine learning approach
本稿では、Kinectからのマルチモーダルデータ(音声、動画、運動)を統合して、Bharatanatyam舞踊におけるポーズおよびシーケンス認識のための機械学習フレームワークを提案する。畳み込みニューラルネットワーク(CNN)を用いたポーズ認識で99%の精度を達成し、キーフレーム抽出でも83.5%の精度を実現した。これにより、Adavu舞踊ユニットの堅牢な分析が可能となり、舞踊の音声記録や指導支援システムへの応用が可能となる。
Understanding the underlying semantics of performing arts like dance is a challenging task. Dance is multimedia in nature and spans over time as well as space. Capturing and analyzing the multimedia content of the dance is useful for the preservation of cultural heritage, to build video recommendation systems, to assist learners to use tutoring systems. To develop an application for dance, three aspects of dance analysis need to be addressed: 1) Segmentation of the dance video to find the representative action elements, 2) Matching or recognition of the detected action elements, and 3) Recognition of the dance sequences formed by combining a number of action elements under certain rules. This paper attempts to solve three fundamental problems of dance analysis for understanding the underlying semantics of dance forms. Our focus is on an Indian Classical Dance (ICD) form known as Bharatanatyam. As dance is driven by music, we use the music as well as motion information for key posture extraction. Next, we recognize the key postures using machine learning as well as deep learning techniques. Finally, the dance sequence is recognized using the Hidden Markov Model (HMM). We capture the multi-modal data of Bharatanatyam dance using Kinect and build an annotated data set for research in ICD.
研究の動機と目的
- インド古典舞踊(ICD)における舞踊動画のセグメンテーション、重要なポーズの認識、舞踊シーケンス認識の根本的課題に取り組むこと。特にBharatanatyamに焦点を当てる。
- 音声(sollukattu)、動画、運動データを統合したマルチモーダルシステムを構築し、舞踊パフォーマンスの意味的理解を向上させること。
- 研究におけるICD分析および意味的モデリングのための、BharatanatyamのAdavuをラベル付けしたアノテート済みデータセットの作成。
- 正確な舞踊ポーズおよびシーケンス認識を通じて、舞踊の音声記録、指導支援システム、アニメーションなどの応用を可能にすること。
- 従来の研究の限界を克服するため、統合フレームワーク内でセグメンテーション、ポーズ認識、シーケンス認識の3つの核心的問題を同時に解決すること。
提案手法
- 音楽的キュー(sollukattuとビート)を用いて舞踊動画をセグメンテーションし、顕著なポーズを表すキーフレーム(K-フレーム)を抽出する。
- Kinectから得たスケルタルジョイントデータとRGBフレームを用い、GMM用の角度特徴量とSVM用のHOG特徴量を抽出してポーズ認識を実行する。
- RGBフレームからのHOG特徴量を用いて畳み込みニューラルネットワーク(CNN)を訓練し、23クラスのポーズを15クラスに統合することで汎化性能を向上させる。
- ポーズ間の時間的遷移に基づいてAdavuパターンを認識できるように、隠れマルコフモデル(HMM)を用いて舞踊シーケンスをモデル化する。
- 指導支援システムの評価において、動きのシーケンスをアライメント・比較するために動的時間ワープ(DTW)を適用する。
- 学習および評価のための、ラベル付け済みのポーズとシーケンスを備えたBharatanatyamのAdavuのアノテート済みデータセットを構築する。
実験結果
リサーチクエスチョン
- RQ1音声と運動のキューを用いて、Bharatanatyamの舞踊動画から効果的に重要なポーズを抽出する方法は何か?
- RQ2スケルタルおよび視覚的データから、明確に区別可能なBharatanatyamのポーズを認識するための機械学習モデルの中で、最も高い精度を達成するのはどれか?
- RQ3隠れマルコフモデル(HMM)を用いて、ポーズの時間的シーケンスから構造的舞踊シーケンス(Adavus)をどのように認識できるか?
- RQ4特徴量エンジニアリングおよびモデルアーキテクチャ(例:GMM、SVM、CNN)がポーズ認識精度に与える影響は何か?
- RQ5提案されたシステムは、舞踊の音声記録や自動指導支援システムといった応用をどの程度サポートできるか?
主な発見
- 音声ベースのセグメンテーションを用いたキーフレーム抽出の精度は83.5%に達した。これは、ビートとsollukattuのキューを活用した結果である。
- スケルタルデータからの角度特徴量を用いたガウス・ミックス・モデル(GMM)は、23クラスのポーズ認識において83%の精度を達成した。
- RGBフレームからのHOG特徴量を用いたサポート・ベクターマシン(SVM)は、ポーズ認識において98%の精度を達成した。
- 23クラスのポーズを15クラスに統合した最適化済み畳み込みニューラルネットワーク(CNN)は、ポーズ認識で99%の精度を達成した。
- HMMベースのシーケンス認識モデルは、Adavuパターンの識別において高い性能を示し、混同行列から各Adavuタイプごとにほぼ完璧な分類が確認された。
- このフレームワークは、舞踊の音声記録、DTWに基づくアライメントを用いた自動指導支援、舞踊シーケンスの3次元アニメーションといった実用的応用を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。