[논문 리뷰] Bangla sign language recognition using concatenated BdSL network
이 논문은 시각적 특징을 CNN에서 추출하고 자세 키포인트 데이터를 자세 추정 네트워크에서 추출하여 융합함으로써 방글라어 수어(BdSL) 인식을 위한 새로운 '연결된 BdSL 네트워크'를 제안한다. 이 방법은 테스트 세트에서 91.51%의 정확도를 달성하여 손가락 자세를 통합함으로써 시각적으로 유사한 BdSL 기호의 인식 성능 향상이 가능함을 보여준다.
Sign language is the only medium of communication for the hearing impaired and the deaf and dumb community. Communication with the general mass is thus always a challenge for this minority group. Especially in Bangla sign language (BdSL), there are 38 alphabets with some having nearly identical symbols. As a result, in BdSL recognition, the posture of hand is an important factor in addition to visual features extracted from traditional Convolutional Neural Network (CNN). In this paper, a novel architecture "Concatenated BdSL Network" is proposed which consists of a CNN based image network and a pose estimation network. While the image network gets the visual features, the relative positions of hand keypoints are taken by the pose estimation network to obtain the additional features to deal with the complexity of the BdSL symbols. A score of 91.51% was achieved by this novel approach in test set and the effectiveness of the additional pose estimation network is suggested by the experimental results.
연구 동기 및 목표
- 시각적 특징만으로는 구분하기 어려운 시각적으로 유사한 방글라어 수어(BdSL) 알파벳을 인식하는 데 도전하는 것.
- 기존의 CNN 기반 접근 방식이 BdSL에서 중요한 손가락 자세의 차이를 포착하지 못하는 한계를 극복하는 것.
- 딥러닝과 자세 추정을 융합하여 복잡한 BdSL 기호의 인식 정확도를 향상시키는 것.
- 시각적 특징과 공간적 손가락 특징 표현을 융합한 하이브리드 아키텍처를 개발하여 강건성을 향상시키는 것.
- 유사한 BdSL 기호의 오분류를 줄이기 위해 추가적인 자세 기반 특징이 얼마나 효과적인지 입증하는 것.
제안 방법
- 이중 분지 신경망 아키텍처 설계: 한 분지는 원본 이미지 입력을 처리하기 위해 컨volution 신경망(CNN)을 통해 시각적 특징을 추출한다.
- 두 번째 분지는 자세 추정 모델을 사용하여 입력 이미지에서 손가락 키포인트의 상대적 위치를 탐지하고 추출한다.
- CNN과 자세 추정 네트워크의 특징 맵을 연결하여 분류를 위한 통합 표현을 형성한다.
- 38개의 서로 다른 알파벳을 포함한 레이블이 부여된 BdSL 데이터셋을 사용하여 종합 네트워크를 엔드 투 엔드로 훈련시킨다.
- 최종 예측을 위한 표준 딥러닝 최적화 기법, 예를 들어 역전파와 소프트맥스 분류를 활용한다.
- 키포인트 좌표를 구조적 사전 지식으로 활용하여 시각적으로 유사하지만 손가락 자세만 다른 기호 간의 구분 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1자세 키포인트 데이터의 융합이 시각적으로 유사한 방글라어 수어 알파벳의 인식 정확도를 향상시킬 수 있는가?
- RQ2연결된 CNN과 자세 추정 네트워크는 BdSL 인식을 위해 시각적 특징과 구조적 손가락 특징을 얼마나 효과적으로 포착하는가?
- RQ3손가락 키포인트 위치에서 유도된 추가적인 공간적 특징은 CNN 전용 모델 대비 BdSL에서의 오분류를 어느 정도 줄이는가?
- RQ4제안된 아키텍처는 BdSL 기준 데이터셋에서 기존의 CNN 기반 접근 방식을 능가하는가?
- RQ5복잡한 BdSL 기호를 인식하는 데 있어 자세 추정 기능이 전체 성능 향상에 기여하는 정도는 어느 정도인가?
주요 결과
- 제안된 연결된 BdSL 네트워크는 테스트 정확도 91.51%를 달성하여 BdSL 인식 작업에서 뛰어난 성능을 보였다.
- 자세 추정 특징의 통합이 특히 시각적으로 유사한 BdSL 기호의 인식에 크게 기여하였다.
- 모델은 유사한 기호를 구분하는 데 핵심적인 요소인 손가락 자세의 미세한 차이를 효과적으로 포착하였다.
- 시각적 특징과 키포인트 기반 특징의 융합은 CNN 전용 기준 모델 대비 명확한 성능 향상을 이끌었다.
- 결과는 구조적 손가락 정보가 시각적 특징과 보완되어 실제 환경에서의 수어 인식에서 강건성을 향상시킨다는 것을 입증하였다.
- 이 아키텍처는 방글라어를 모국어로 사용하는 지역의 청각 장애인 및 听覚 장애인을 위한 보조 통신 시스템에 구현 가능성이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.