[논문 리뷰] Neural Sign Language Translation based on Human Keypoint Estimation
이 논문은 영상에서 2차원 인간 관절 추정을 사용하여 신원 언어 번역 시스템을 제안하며, 관절 특징에 대한 새로운 정규화 기법을 활용한다. 새로 제안된 14,672개의 고품질 영상으로 구성된 KETI 한국 수어 데이터셋을 기반으로 훈련되었으며, 순서-순서 아키텍처와 주목기반 메커니즘을 사용하여 105개의 응급 상황 관련 문장에 대해 검증 세트에서 93.28%의 정확도와 테스트 세트에서 55.28%의 정확도를 달성한다.
We propose a sign language translation system based on human keypoint estimation. It is well-known that many problems in the field of computer vision require a massive amount of dataset to train deep neural network models. The situation is even worse when it comes to the sign language translation problem as it is far more difficult to collect high-quality training data. In this paper, we introduce the KETI (short for Korea Electronics Technology Institute) sign language dataset which consists of 14,672 videos of high resolution and quality. Considering the fact that each country has a different and unique sign language, the KETI sign language dataset can be the starting line for further research on the Korean sign language translation. Using the KETI sign language dataset, we develop a neural network model for translating sign videos into natural language sentences by utilizing the human keypoints extracted from a face, hands, and body parts. The obtained human keypoint vector is normalized by the mean and standard deviation of the keypoints and used as input to our translation model based on the sequence-to-sequence architecture. As a result, we show that our approach is robust even when the size of the training data is not sufficient. Our translation model achieves 93.28% (55.28%, respectively) translation accuracy on the validation set (test set, respectively) for 105 sentences that can be used in emergency situations. We compare several types of our neural sign translation models based on different attention mechanisms in terms of classical metrics for measuring the translation performance.
연구 동기 및 목표
- 딥 러닝 모델 훈련을 위한 대규모 고품질 수어 데이터셋의 부족한 문제를 해결하기 위해.
- 인간 관절 특징을 사용하여 수어 영상에서 자연어 문장으로 번역하는 신경 수어 번역 시스템을 개발하기 위해.
- 관절 좌표를 정규화하고 시공간 모델링을 활용하여 데이터가 적은 환경에서도 성능을 향상시키기 위해.
- 손, 얼굴, 몸 등 다양한 신체 부위가 수어 번역 성능에 기여하는 정도를 평가하기 위해.
- 국가별 특화 데이터셋(Korean)을 활용하여 향후 수어 번역 연구의 기반을 마련하기 위해.
제안 방법
- 시스템은 수어 영상에서 얼굴, 손, 몸을 포함한 135개의 인간 관절 2차원 좌표를 OpenPose를 사용해 추출한다.
- 각 관절별 평균과 표준편차를 사용하여 관절 좌표를 정규화하여 수어자 간 및 카메라 각도에 따른 변동을 줄인다.
- 정규화된 관절 시퀀스는 주목기반 메커니즘을 갖춘 순서-순서 신경 번역 모델에 입력된다.
- 모델은 시간적 관절 임베딩 시퀀스를 해당하는 한국어 자연어 문장으로 매핑하도록 훈련된다.
- 번역 성능 최적화를 위해 다양한 주목기반 메커니즘(Bahdanov, Luong 등)을 비교한다.
- 손, 얼굴, 몸의 관절 정보가 별개로 및 조합적으로 기여하는 정도를 평가하기 위해 추론 분석(ablation study)를 실시한다.
실험 결과
연구 질문
- RQ1인간 관절 추정은 수어 번역의 특징 표현으로 얼마나 효과적인가?
- RQ2손, 얼굴, 몸 등 다양한 신체 부위가 번역 정확도에 얼마나 기여하는가?
- RQ3정규화된 관절 표현은 제한된 훈련 데이터에서 모델 일반화 성능을 향상시킬 수 있는가?
- RQ4혼잡한 배경과 전문가가 아닌 수어자와 같은 실생활 변형 상황에서 제안된 시스템의 성능은 어떠한가?
- RQ5주목기반 메커니즘이 수어 모델링의 번역 품질에 미치는 영향은 무엇인가?
주요 결과
- 제안된 시스템은 105개의 응급 상황 관련 문장에 대해 검증 세트에서 93.28%의 번역 정확도와 테스트 세트에서 55.28%의 정확도를 달성한다.
- 실생활 조건에 잘 일반화되어 있으며, 비전문가 수어자와 혼잡한 배경이 있는 테스트 세트에서 ROUGE-L 89.06, METEOR 60.64, BLEU 77.08, CIDEr 2.860을 기록한다.
- 양손의 관절 정보가 성능 향상에 가장 크게 기여하며, 손만을 사용할 경우 ROUGE-L 점수는 72.03을 기록한다.
- 얼굴 관절 정보를 추가하면 성능이 일관되게 저하되며, 이는 얼굴 관절 수(70개)가 몸(12개)과 손(24개)에 비해 과도하게 많기 때문일 것이다.
- 몸 관절 정보를 통합하면 성능 향상(손과 몸 조합 시 ROUGE-L 74.02)이 이루어지며, 상대적 공간 관계 손실에도 불구하고 몸 관절이 유용한 위치적 맥락을 제공함을 시사한다.
- 추론 분석 결과, 이 설정에서 손과 몸 관절 정보는 얼굴 관절 정보보다 더 유용한 정보를 제공함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.