Skip to main content
QUICK REVIEW

[논문 리뷰] Egyptian Sign Language Recognition Using CNN and LSTM

Ahmed Elhagry, Rawan Gla|arXiv (Cornell University)|2021. 07. 28.
Hand Gesture Recognition Systems참고 문헌 8인용 수 4
한 줄 요약

이 논문은 청각 장애인과 听覚 인구 간의 소통 격차를 해소하기 위해 영상 기반 이집트 수어(ESL) 인식 시스템을 제안한다. 이는 컨volutional 신경망(CNN)과 장기 단기 기억(LSTM) 네트워크를 사용한다. CNN은 프레임에서 공간적 특징을 추출하고, CNN-LSTM 아키텍처는 공간적 및 시간적 동적 특징을 모두 캡처하여 9개의 일반적인 ESL 단어에서 90%의 정확도를 달성한다.

ABSTRACT

Sign language is a set of gestures that deaf people use to communicate. Unfortunately, normal people don't understand it, which creates a communication gap that needs to be filled. Because of the variations in (Egyptian Sign Language) ESL from one region to another, ESL provides a challenging research problem. In this work, we are providing applied research with its video-based Egyptian sign language recognition system that serves the local community of deaf people in Egypt, with a moderate and reasonable accuracy. We present a computer vision system with two different neural networks architectures. The first is a Convolutional Neural Network (CNN) for extracting spatial features. The CNN model was retrained on the inception mod. The second architecture is a CNN followed by a Long Short-Term Memory (LSTM) for extracting both spatial and temporal features. The two models achieved an accuracy of 90% and 72%, respectively. We examined the power of these two architectures to distinguish between 9 common words (with similar signs) among some deaf people community in Egypt.

연구 동기 및 목표

  • 청각 장애인들이 사용하는 이집트 수어(ESL)와 听覚 인구 간의 소통 격차를 해소하기 위해.
  • 지역적 변형이 존재하는 ESL로 인해 일관된 수어 인식에 도전 과제가 되는 문제를 해결하기 위해.
  • 이집트의 청각 장애 공동체에 맞는 실용적이고 현지화된 컴퓨터 비전 시스템을 개발하기 위해.
  • 지역화된 ESL 데이터셋에서 두 가지 딥 러닝 아키텍처—CNN과 CNN-LSTM—의 성능을 평가하기 위해.
  • 유사한 제스처를 가진 일반적인 ESL 단어를 정확하게 인식하여 오분류를 줄이기 위해 중간에서 높은 정확도를 달성하기 위해.

제안 방법

  • 자체 제작한 영상 데이터셋에 대해 프리트레이닝된 인셉션 기반 CNN 모델을 미세조정하여 사용하였다.
  • CNN 구성 요소를 통해 개별 영상 프레임에서 공간적 특징을 추출하여 손 모양과 위치를 캡처하였다.
  • CNN과 LSTM 네트워크를 결합하여 프레임 간의 순차적 의존성을 모델링하고 수어 동작의 시간적 동적 특징을 포착하였다.
  • 9개의 일반적인 ESL 단어를 분류하기 위해 영상 시퀀스에서 끝에서 끝까지 CNN-LSTM 아키텍처를 훈련시켰다.
  • 제한된 현지 데이터에서의 일반화 성능 향상을 위해 영상 데이터 증강 및 전이 학습 기법을 적용하였다.
  • 보류된 테스트 세트의 수어 영상에서 정확도 지표를 사용하여 모델 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1CNN 기반 모델은 공간적 특징만을 사용하여 이집트 수어 제스처를 높은 정확도로 인식할 수 있는가?
  • RQ2LSTM를 통한 시간 모델링이 동적 수어 제스처 인식 정확도에 얼마나 기여하는가?
  • RQ3이집트 수어의 지역적 변형이 딥 러닝 기반 인식 시스템의 성능에 어떻게 영향을 미치는가?
  • RQ4지역화된 ESL 데이터셋에서 단독 CNN과 CNN-LSTM 하이브리드 아키텍처 간의 성능 차이는 무엇인가?
  • RQ5중간 크기의 현지 데이터셋에서 훈련된 딥 러닝 시스템이 실생활 이집트 수어 소통 응용 분야에서 실용적인 정확도를 달성할 수 있는가?

주요 결과

  • 단독 CNN 모델은 9개의 일반적인 이집트 수어 단어 테스트 세트에서 90%의 인식 정확도를 달성하였다.
  • CNN-LSTM 하이브리드 모델은 72%의 낮은 정확도를 기록하여, 이 특정 설정에서는 시간 모델링이 성능 향상에 기여하지 않았음을 시사한다.
  • 결과는 선택된 유사 제스처 단어 집합에서 공간적 특징만으로도 매우 구분력이 있음을 시사한다.
  • 단독 CNN 모델의 높은 정확도는 지역화된 수어 인식에 대해 인셉션 기반 아키텍처를 사용한 전이 학습의 효과성을 입증한다.
  • 두 모델 간의 성능 격차는 시간적 동적이지 않은 경우 LSTM를 추가할 경우 노이즈나 과적합이 발생할 수 있음을 시사한다.
  • 높은 정확도와 지역 데이터 집중으로 인해 이 시스템은 이집트의 청각 장애 공동체에서 실생활 구현 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.