[논문 리뷰] Statistical and Spatio-temporal Hand Gesture Features for Sign Language Recognition using the Leap Motion Sensor
이 연구는 레이프 모션 센서를 사용한 수어 인식을 위한 하이브리드 특징 추출 방법을 제안하며, 통계적 특징과 시공간적 특징을 융합하여 제스처 분류 성능을 햖थ한다. 최고의 성능을 보인 모델은 240개의 통계적 특징과 240개의 시공간적 특징을 사용하여 86.75%의 정확도를 달성하였으며, 이는 동적 수어 인식에서 융합된 특징 세트가 단일 특징 접근 방식보다 우수함을 보여준다.
In modern society, people should not be identified based on their disability, rather, it is environments that can disable people with impairments. Improvements to automatic Sign Language Recognition (SLR) will lead to more enabling environments via digital technology. Many state-of-the-art approaches to SLR focus on the classification of static hand gestures, but communication is a temporal activity, which is reflected by many of the dynamic gestures present. Given this, temporal information during the delivery of a gesture is not often considered within SLR. The experiments in this work consider the problem of SL gesture recognition regarding how dynamic gestures change during their delivery, and this study aims to explore how single types of features as well as mixed features affect the classification ability of a machine learning model. 18 common gestures recorded via a Leap Motion Controller sensor provide a complex classification problem. Two sets of features are extracted from a 0.6 second time window, statistical descriptors and spatio-temporal attributes. Features from each set are compared by their ANOVA F-Scores and p-values, arranged into bins grown by 10 features per step to a limit of the 250 highest-ranked features. Results show that the best statistical model selected 240 features and scored 85.96% accuracy, the best spatio-temporal model selected 230 features and scored 80.98%, and the best mixed-feature model selected 240 features from each set leading to a classification accuracy of 86.75%. When all three sets of results are compared (146 individual machine learning models), the overall distribution shows that the minimum results are increased when inputs are any number of mixed features compared to any number of either of the two single sets of features.
연구 동기 및 목표
- 통계적 특징과 시공간적 손 제스처 특징이 수어 인식 정확도에 미치는 영향을 조사하기 위해.
- 단지 통계적 특징, 단지 시공간적 특징, 또는 둘 다를 사용하는 모델의 분류 성능를 비교하기 위해.
- 모델 일반화를 향상시키기 위해 ANOVA F-값과 p-값을 사용하여 각 특징 세트에서 최적의 특징 수를 특정하기 위해.
- 특징 융합이 단일 특징 접근 방식에 비해 동적 제스처 인식에서 정확도와 강인성 향상에 기여하는지 평가하기 위해.
제안 방법
- 손 제스처 데이터의 0.6초 시간 윈도우에서 통계적 특징을 추출하였으며, 위치와 속도의 평균, 분산 및 고차 모멘트를 포함한다.
- 시공간적 특징은 궤적의 동역학에서 유도되었으며, 가속도, 곡률 및 손 움직임의 시간적 진행 패턴을 포함한다.
- 특징 선택은 ANOVA F-값과 p-값을 사용하여 수행되었으며, 유의미도 기반으로 특징을 순위 매기고, 각 세트에서 최대 250개까지 선택하였다.
- 선택된 특징의 조합을 사용하여 총 146개의 기계 학습 모델을 훈련시켰으며, 일반화 성능가 뛰어나므로 랜덤 포레스트를 기본 분류기로 사용하였다.
- 모델 평가에는 10겹 교차 검증을 사용하였으며, 정확도, 정밀도, 재현율 및 F1-스코어와 같은 지표를 사용하였다.
- 특징 융합은 초기 융합 방식으로 구현되었으며, 모델 훈련 이전에 통계적 특징과 시공간적 특징을 연결하였다.
실험 결과
연구 질문
- RQ1레이프 모션 데이터를 사용할 때, 통계적 특징과 시공간적 특징은 동적 수어 제스처 분류에서 어떻게 비교되는가?
- RQ2각 범주(통계적 및 시공간적)에서 분류 정확도를 최대화하는 데 최적의 특징 수는 얼마인가?
- RQ3통계적 특징과 시공간적 특징을 융합하면 단일 특징 세트를 사용하는 것보다 더 나은 성능을 내는가?
- RQ4특징 융합은 교차 검증 점수의 표준편차를 통해 측정된 모델의 안정성과 강인성에 어떤 영향을 미치는가?
- RQ5ANOVA F-값을 기반으로 한 특징 선택은 모델 성능과 계산 복잡도에 어떤 영향을 미치는가?
주요 결과
- 최고의 성능을 보인 모델은 240개의 통계적 특징과 240개의 시공간적 특징을 사용하여 평균 정확도 86.75%와 F1-스코어 0.867을 달성하였다.
- 단지 통계적 특징을 사용한 모델는 85.96%의 정확도를 기록하였으며, 순수한 시공간적 특징 모델(80.98% 정확도)보다 뛰어나, 이 데이터셋에서는 통계적 특징이 더 구분력이 있음을 시사한다.
- 특징 혼합 시, 가장 성능이 열악한 모델들조차도 단일 특징 유형을 사용한 가장 열악한 모델들보다 성능이 뛰어나, 융합으로 인해 강인성이 향상됨을 보여준다.
- 10개의 최상위 모델 중 상위 7개는 하이브리드 모델이었으며, 8번째로 좋은 모델은 통계적 특징 전용 모델이었으며, 이는 혼합 특징이 일관되게 뛰어난 성능을 내는 것을 의미한다.
- 최고의 하이브리드 모델의 표준편차(0.90)는 최고의 통계적 특징 전용 모델(0.51)보다 높아, 특징 유형을 융합할 경우 정확도와 안정성 사이에 상충 관계가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.