[논문 리뷰] Posture and sequence recognition for Bharatanatyam dance performances using machine learning approach
이 논문은 Kinect에서 수집한 다중 모odal 데이터(음성, 영상, 운동 신호)를 활용하여 비하라타니아얌 무용의 자세 및 순서 인식을 위한 기계 학습 프레임워크를 제안한다. 컨볼루션 신경망(CNN)을 사용한 자세 인식에서는 99%의 정확도를 달성하였고, 핵심 프레임 추출 정확도는 83.5%로, 광범위한 분석이 가능한 아다부 무용 단위의 정확한 분석을 가능하게 한다. 이는 무용 전사 및 지도 시스템 등의 응용 분야에 기여한다.
Understanding the underlying semantics of performing arts like dance is a challenging task. Dance is multimedia in nature and spans over time as well as space. Capturing and analyzing the multimedia content of the dance is useful for the preservation of cultural heritage, to build video recommendation systems, to assist learners to use tutoring systems. To develop an application for dance, three aspects of dance analysis need to be addressed: 1) Segmentation of the dance video to find the representative action elements, 2) Matching or recognition of the detected action elements, and 3) Recognition of the dance sequences formed by combining a number of action elements under certain rules. This paper attempts to solve three fundamental problems of dance analysis for understanding the underlying semantics of dance forms. Our focus is on an Indian Classical Dance (ICD) form known as Bharatanatyam. As dance is driven by music, we use the music as well as motion information for key posture extraction. Next, we recognize the key postures using machine learning as well as deep learning techniques. Finally, the dance sequence is recognized using the Hidden Markov Model (HMM). We capture the multi-modal data of Bharatanatyam dance using Kinect and build an annotated data set for research in ICD.
연구 동기 및 목표
- 인도 고전 무용(ICD) 분석 분야에서 핵심적인 과제인 무용 영상 분할, 핵심 자세 인식, 무용 순서 인식 문제를 해결하기 위해 비하라타니아얌을 중심으로 연구한다.
- 음성(sollukattu), 영상, 운동 데이터를 융합한 다중 모달 시스템을 개발하여 무용 공연의 의미적 이해를 향상시킨다.
- 연구를 위한 ICD 분석 및 의미 모델링에 기여할 수 있도록 비하라타니아얌 아다부에 대한 레이블이 부여된 데이터셋을 구축한다.
- 정확한 자세 및 순서 인식을 통해 무용 전사, 지도 시스템, 애니메이션 등의 응용 분야를 실현한다.
- 이전 연구의 한계를 극복하기 위해 분할, 자세 인식, 순서 인식의 세 가지 핵심 문제를 통합된 프레임워크 내에서 동시에 해결한다.
제안 방법
- 음악적 신호(sollukattu 및 비트)를 활용해 무용 영상 분할 및 핵심 프레임(K-프레임) 추출을 수행하여 주목할 만한 자세를 대표하는 프레임을 확보한다.
- Kinect를 통해 골격 관절 데이터와 RGB 프레임을 추출하여, GMM에 사용할 각도 특징과 SVM에 사용할 HOG 특징을 생성한다.
- RGB 프레임의 HOG 특징을 기반으로 컨볼루션 신경망(CNN)을 훈련시키며, 23개의 자세 클래스를 15개로 통합하여 일반화 능력을 향상시킨다.
- 자세 간의 시간적 전이 패턴을 기반으로 HMM(은닉 마르코프 모델)을 활용해 아다부 패턴을 인식하는 무용 순서 모델을 구축한다.
- 지도 시스템 평가를 위해 운동 시퀀스의 정렬 및 비교에 동적 시간 왜곡(DTW)을 적용한다.
- 훈련 및 평가를 위한 레이블이 부여된 비하라타니아얌 아다부 데이터셋을 구축한다.
실험 결과
연구 질문
- RQ1음성 및 운동 신호를 활용해 비하라타니아얌 무용 영상에서 핵심 자세를 효과적으로 추출할 수 있는가?
- RQ2골격 및 시각적 데이터로부터 비하라타니아얌의 다양한 자세를 인식하는 데 있어 어떤 기계 학습 모델이 가장 높은 정확도를 달성하는가?
- RQ3은닉 마르코프 모델(HMM)을 활용해 자세의 시간적 순서를 기반으로 구조화된 무용 순서(아다부)를 어떻게 인식할 수 있는가?
- RQ4특징 공학 및 모델 아키텍처(GMM, SVM, CNN 등)가 자세 인식 정확도에 미치는 영향은 어떠한가?
- RQ5제안된 시스템이 무용 전사 및 자동 지도 시스템 등의 응용 분야에서 얼마나 효과적으로 활용될 수 있는가?
주요 결과
- 음성 기반 분할을 통해 핵심 프레임 추출 정확도가 83.5%에 도달하였으며, 비트 및 sollukattu 신호를 효과적으로 활용하였다.
- 골격 데이터에서 추출한 각도 특징을 활용한 가우시안 믹스처 모델(GMM)은 23개 클래스의 자세 인식에서 83%의 정확도를 기록하였다.
- RGB 프레임의 HOG 특징을 활용한 서포트 벡터 머신(SVM)은 자세 인식에서 98%의 정확도를 달성하였다.
- 23개의 자세 클래스를 15개로 통합한 최적화된 컨볼루션 신경망(CNN)은 자세 인식에서 99%의 정확도를 달성하였다.
- HMM 기반의 순서 인식 모델은 아다부 패턴을 인식하는 데 높은 성능을 보였으며, 혼동 행렬을 통해 각 아다부 유형에 대해 거의 완벽한 분류 성능을 입증하였다.
- 이 프레임워크는 무용 전사, DTW 기반 정렬을 활용한 자동 지도 시스템, 무용 시퀀스의 3D 애니메이션 등 실용적 응용을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.