Skip to main content
QUICK REVIEW

[논문 리뷰] Hand Gesture Recognition with Two Stage Approach Using Transfer Learning and Deep Ensemble Learning

Serkan Savaş, Atilla Ergüzen|arXiv (Cornell University)|2023. 09. 20.
Hand Gesture Recognition SystemsComputer Science인용 수 3
한 줄 요약

이 논문은 HG14 데이터셋에서 전이 학습과 딥 앙상블 학습을 조합한 이단계 수준의 손동작 인식 프레임워크를 제안한다. 사전 학습된 VGG 및 MobileNet 모델을 미세 조정하고, Dirichlet 기법을 통해 예측을 앙상블하여 98.88%의 정확도를 달성하였으며, 개별 모델보다 뚜렷이 높은 성능을 보이며 HCI 응용 분야에서 앙상블 방법의 유효성을 입증한다.

ABSTRACT

Human-Computer Interaction (HCI) has been the subject of research for many years, and recent studies have focused on improving its performance through various techniques. In the past decade, deep learning studies have shown high performance in various research areas, leading researchers to explore their application to HCI. Convolutional neural networks can be used to recognize hand gestures from images using deep architectures. In this study, we evaluated pre-trained high-performance deep architectures on the HG14 dataset, which consists of 14 different hand gesture classes. Among 22 different models, versions of the VGGNet and MobileNet models attained the highest accuracy rates. Specifically, the VGG16 and VGG19 models achieved accuracy rates of 94.64% and 94.36%, respectively, while the MobileNet and MobileNetV2 models achieved accuracy rates of 96.79% and 94.43%, respectively. We performed hand gesture recognition on the dataset using an ensemble learning technique, which combined the four most successful models. By utilizing these models as base learners and applying the Dirichlet ensemble technique, we achieved an accuracy rate of 98.88%. These results demonstrate the effectiveness of the deep ensemble learning technique for HCI and its potential applications in areas such as augmented reality, virtual reality, and game technologies.

연구 동기 및 목표

  • 딥 러닝을 활용하여 인간-컴퓨터 상호작용(HCI) 분야에서 손동작 인식 정확도를 향상시키기 위해.
  • 14개의 손동작 클래스를 포함한 HG14 데이터셋에서 사전 학습된 딥 네트워크의 성능을 평가하기 위해.
  • 다양한 고성능 모델을 조합하는 데에 앙상블 학습의 효과성을 탐색하기 위해.
  • 증강현실 및 가상현실과 같은 응용 분야에서 제안된 방법의 실용적 잠재력을 입증하기 위해.

제안 방법

  • 전이 학습을 사용하여 HG14 데이터셋에서 사전 학습된 22개의 딥 러닝 모델, VGGNet 및 MobileNet 변종을 미세 조정함.
  • 성능이 가장 높은 네 개의 모델—VGG16, VGG19, MobileNet, MobileNetV2—를 선별하여 앙상블 통합에 활용함.
  • 기본 학습기의 예측을 융합하기 위해 Dirichlet 앙상블 기법을 적용하여 융합 과정을 최적화함.
  • 이중 단계 접근 방식을 사용함: 첫 번째 단계는 전이 학습을 통한 모델 훈련, 두 번째 단계는 앙상블 기반의 예측 융합.
  • HG14 데이터셋의 테스트 분할에서 표준 정확도 지표를 사용하여 성능 평가함.

실험 결과

연구 질문

  • RQ1사전 학습된 모델을 사용한 전이 학습이 HG14 데이터셋에서 손동작 인식에 높은 정확도를 달성할 수 있는가?
  • RQ2HG14 데이터셋에서 손동작 분류에 가장 잘 성능을 내는 딥 러닝 아키텍처는 무엇인가?
  • RQ3앙상블 학습이 개별 모델을 초월해 인식 정확도를 뚜렷이 향상시킬 수 있는가?
  • RQ4Dirichlet 기반 앙상블 기법이 다수의 고성능 모델 예측을 효과적으로 융합할 수 있는가?

주요 결과

  • 평가된 모델들 중에서 MobileNet이 가장 높은 개별 정확도 96.79%를 기록함.
  • VGG16과 VGG19는 각각 94.64% 및 94.36%의 정확도를 기록하여 뛰어난 성능를 보임.
  • 네 개의 최상위 성능 모델을 융합한 딥 앙상블 모델은 98.88%의 정확도를 달성하여 개별 모델보다 뚜렷이 높은 성능를 보임.
  • Dirichlet 앙상블 기법은 다양한 예측을 효과적으로 활용하여 오류를 감소시키고 정확도를 향상시킴.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.