[논문 리뷰] Visual Recognition of Isolated Swedish Sign Language Signs
이 논문은 3D 손 움직임, 손 자세, 깊이 특징을 활용하여 고립된 스웨덴 수어(SSL) 표지를 인식하는 강건한 RGB-D 기반 시스템을 제시한다. 서명자에 의존하는 변동성을 줄이기 위해 피셔 선형 할당 분석(LDA)을 적용한 결과, 94단어 어휘에서 서명자에 의존하는 인식에서는 94%의 정확도를 달성하고, 서명자에 의존하지 않는 인식에서는 47%의 정확도를 기록하여 기준 방법에 비해 상당한 향상을 보였다.
We present a method for recognition of isolated Swedish Sign Language signs. The method will be used in a game intended to help children training signing at home, as a complement to training with a teacher. The target group is not primarily deaf children, but children with language disorders. Using sign language as a support in conversation has been shown to greatly stimulate the speech development of such children. The signer is captured with an RGB-D (Kinect) sensor, which has three advantages over a regular RGB camera. Firstly, it allows complex backgrounds to be removed easily. We segment the hands and face based on skin color and depth information. Secondly, it helps with the resolution of hand over face occlusion. Thirdly, signs take place in 3D; some aspects of the signs are defined by hand motion vertically to the image plane. This motion can be estimated if the depth is observable. The 3D motion of the hands relative to the torso are used as a cue together with the hand shape, and HMMs trained with this input are used for classification. To obtain higher robustness towards differences across signers, Fisher Linear Discriminant Analysis is used to find the combinations of features that are most descriptive for each sign, regardless of signer. Experiments show that the system can distinguish signs from a challenging 94 word vocabulary with a precision of up to 94% in the signer dependent case and up to 47% in the signer independent case.
연구 동기 및 목표
- 언어 장애가 있는 어린이들을 위한 실시간 수어 인식 시스템을 개발하여 수어 사용을 통해 언어 발달을 지원한다.
- 특히 일관되거나 변화하는 수어 습관을 보이는 听력 장애가 없는 수어자들 사이에서 발생하는 수어 습관의 높은 변동성을 해결한다.
- 복잡한 배경, 조명, 의복 변화가 있는 자연 환경에서도 시스템의 강건성을 향상시킨다.
- 손 움직임 특징에 깊이 정보를 통합하여 더 나은 3D 궤적 모델링을 통해 인식 성능을 향상시킨다.
- 서명자에 의존하지 않는 인식을 가능하게 하기 위해 LDA 기반 특징 변환을 통해 개인의 수어 습관에서 클래스 관련 특징을 분리한다.
제안 방법
- 시스템은 실시간으로 수어자로부터 색상, 깊이, 운동 데이터를 캡처하기 위해 RGB-D 센서(Kinect)를 사용한다.
- 피부 색상, 깊이 임계값, 운동 신호를 활용하여 손과 얼굴을 분할하여 복잡한 배경에서 손을 분리한다.
- 손 위치를 몸통 기준으로 시간에 따라 추적하여 3D 손 궤적을 추출하며, 이는 주요 운동 특징이 된다.
- 손 자세는 손 윤곽선에 대한 기울기 기울기 히스토그램(HOG)을 사용하여 표현하고, 깊이 맵에서 형태 기저(형태 기술자 S)를 계산한다.
- 피셔 선형 할당 분석(LDA)을 적용하여 고차원 특징 벡터를 상호 클래스 간 분離도를 극대화하고, 서명자 간 내부 클래스 변동도를 최소화하는 저차원 공간으로 투영한다.
- 숨은 마르코프 모델(HMM)은 LDA 변환된 특징에 대해 학습되며, 각 수어에 대해 별도의 모델이 사용된다.
실험 결과
연구 질문
- RQ13D 손 움직임 기반 인식 시스템은 자연적이고 통제되지 않은 환경에서 고립된 스웨덴 수어 표지를 높은 정확도로 인식할 수 있는가?
- RQ22D RGB만을 사용하는 특징에 비해 깊이 정보를 통합할 경우 인식 성능 향상 정도는 어느 정도인가?
- RQ3피셔 LDA는 개인의 수어 습관 차이가 인식 정확도에 미치는 영향을 얼마나 효과적으로 줄이는가?
- RQ4언어 장애가 있는 어린이들 중 수어 습관의 변동성이 높은 이들에게 시스템이 신뢰할 수 있는 서명자에 의존하지 않는 인식을 수행할 수 있는가?
- RQ5실제 세계의 게임 기반 학습 환경에서 서명자에 의존하는 인식과 서명자에 의존하지 않는 인식 간의 성능 격차는 어느 정도인가?
주요 결과
- 94단어의 SSL 어휘에서 시스템은 서명자에 의존하는 인식 정확도가 94%에 도달하여 개인의 수어 습관에 대한 강건성을 입증하였다.
- 서명자에 의존하지 않는 설정에서 LDA 특징 변환 후 시스템은 47%의 정확도를 기록하였으며, 이는 LDA 없이 사용한 기준 방법 대비 10~15% 향상된 결과이다.
- 서명자 A의 경우 LDA(25)를 사용했을 때 최고 성능로 39.97%를 기록하여, LDA가 일관된 수어를 사용하는 이들에게서 인식 성능 향상에 크게 기여함을 보였다.
- LDA는 불규칙하고 확률적인 수어 습관을 보이는 서명자 B의 경우 성능 향상에 기여하지 못했으며, 이는 LDA가 비일관된 수어자에 대해 한계를 가짐을 시사한다.
- 혼동 행렬 분석 결과, LDA는 서명자 간 변동성이 높은 수어에서 오류를 가장 효과적으로 줄였고, 반면 서명자 간 일관되게 수행되는 수어에는 영향을 거의 미치지 않았다.
- 운동 특징에 깊이 정보를 포함시킴으로써 인식 성능 향상이 뚜렷하게 나타났으며, 3D 운동은 이미지 평면에 대해 수직으로 움직이는 수어에 중요한 단서를 제공함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.