[논문 리뷰] Optimization of Transfer Learning for Sign Language Recognition Targeting Mobile Platform
이 논문은 27,455개의 손동작 이미지를 사용하여 실시간 미국 수어(ASL) 알파벳 인식을 위한 모바일 최적화 전이학습 시스템을 제안한다. 사전 훈련된 딥러닝 모델을 미세조정하고 모바일 배포를 최적화함으로써, 메모리 효율적인 모바일 애플리케이션에서 평균 추론 시간 2.42초에 95.03%의 정확도를 달성한다.
The target of this research is to experiment, iterate and recommend a system that is successful in recognition of American Sign Language (ASL). It is a challenging as well as an interesting problem that if solved will bring a leap in social and technological aspects alike. In this paper, we propose a real-time recognizer of ASL based on a mobile platform, so that it will have more accessibility and provides an ease of use. The technique implemented is Transfer Learning of new data of Hand gestures for alphabets in ASL to be modelled on various pre-trained high- end models and optimize the best model to run on a mobile platform considering the various limitations of the same during optimization. The data used consists of 27,455 images of 24 alphabets of ASL. The optimized model when ran over a memory-efficient mobile application, provides an accuracy of 95.03% of accurate recognition with an average recognition time of 2.42 seconds. This method ensures considerable discrimination in accuracy and recognition time than the previous research.
연구 동기 및 목표
- 청각장애인 및 听력장애가 있는 사람들에 대한 접근성을 향상시키기 위해 실시간으로 작동하며 모바일 기기에서 구동 가능한 미국 수어(ASL) 알파벳 인식 시스템을 개발하는 것.
- 메모리와 처리 능력이 제한된 자원이 부족한 모바일 플랫폼에 정확한 딥러닝 모델을 구현하는 데 도전하는 것.
- 사용자 정의된 ASL 손동작 데이터셋을 기반으로 사전 훈련된 모델을 미세조정하여 최대의 정확도와 효율성을 확보하기 위해 전이학습을 최적화하는 것.
- 실시간 모바일 애플리케이션에 적합한 높은 인식 정확도와 낮은 추론 지연 시간 사이의 균형을 이루는 것.
제안 방법
- 딥 뉴럴 네트워크를 사전 훈련된 ImageNet 모델로 초기화하여 학습된 계층적 특징을 활용함으로써 전이학습을 적용한다.
- 24개의 ASL 알파벳을 나타내는 27,455장의 이미지로 구성된 사용자 정의 데이터셋을 수집하여 사전 훈련된 모델의 미세조정에 사용한다.
- 모델 크기와 추론 시간을 줄이기 위해 지식 증류, 프루닝, 양자화 등의 최적화 기법을 적용하여 모바일 배포에 적합하게 한다.
- 최종 모델은 메모리 효율적인 모바일 애플리케이션에 배포되어 실시간 추론을 가능하게 한다.
- 성능 평가는 모바일 플랫폼에서의 정확도와 평균 추론 시간을 기준으로 한다.
- 다양한 사전 훈련된 모델들(예: MobileNet, DenseNet)을 비교하여 모바일 배포에 최적화된 아키텍처를 식별한다.
실험 결과
연구 질문
- RQ1자원 제약이 있는 모바일 기기에서 고정밀도를 유지하면서 ASL 손동작 인식에 최적화된 사전 훈련된 딥러닝 모델은 무엇인가?
- RQ2전이학습을 어떻게 최적화하여 모델 크기와 추론 시간을 줄일 수 있으며, 동시에 모바일 플랫폼에서의 인식 정확도를 손상시키지 않을 수 있는가?
- RQ3실제 모바일 애플리케이션에 미세조정된 모델을 배포했을 때 달성 가능한 정확도와 추론 속도 수준은 어느 정도인가?
- RQ4기존의 연구와 비교했을 때, 제안된 시스템은 ASL 인식 분야에서 정확도와 실시간 성능 측면에서 어떤가?
- RQ5양자화, 프루닝 등의 모델 압축 기법 중에서 모델 효율성과 인식 성능 사이의 최적의 트레이드오프를 이루는 기법은 무엇인가?
주요 결과
- 최적화된 모델은 모바일 플랫폼에 배포된 상태에서 ASL 알파벳 데이터셋에서 95.03%의 인식 정확도를 달성했다.
- 모든 클래스에 대한 평균 추론 시간은 2.42초였으며, 이는 모바일 배포에 대한 실시간 가능성임을 입증했다.
- 모바일 하드웨어에서 이전의 접근 방식보다 정확도와 추론 효율성 측면에서 모두 뛰어난 성능을 보였다.
- MobileNet 기반 모델은 최적화 후 높은 정확도와 빠른 속도 사이의 균형을 효과적으로 확보하여 뛰어난 성능을 보였다.
- 양자화와 프루닝과 같은 모델 압축 기법은 모델 크기를 크게 줄였으며 동시에 높은 정확도를 유지하는 데 기여했다.
- 사용자 정의된 ASL 데이터셋을 기반으로 사전 훈련된 모델을 미세조정함으로써, 초기 무작위 가중치로 훈련하는 것보다 상당한 성능 향상을 이룰 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.