Skip to main content
QUICK REVIEW

[논문 리뷰] American Sign Language fingerspelling recognition in the wild

Bowen Shi, Aurora Martinez Del Rio|arXiv (Cornell University)|2018. 10. 26.
Hand Gesture Recognition Systems참고 문헌 34인용 수 5
한 줄 요약

이 논문은 자연스럽게 발생하는 온라인 영상에서 미국 수어 손가락 문자 인식에 대한 최초의 연구를 제시하며, 이 작업을 위한 가장 큰 공개 데이터셋을 소개한다. 특수하게 설계된 손 감지기와 시퀀스 모델—특히 CTC 기반 아키텍처를 사용하여, 낮은 프레임 레이트와 시각적 변동성으로 인한 도전 과제에도 불구하고 42%의 문자 정확도를 달성하여, 향후 실생활 수어 인식 연구를 위한 기준선을 설정한다.

ABSTRACT

We address the problem of American Sign Language fingerspelling recognition in the wild, using videos collected from websites. We introduce the largest data set available so far for the problem of fingerspelling recognition, and the first using naturally occurring video data. Using this data set, we present the first attempt to recognize fingerspelling sequences in this challenging setting. Unlike prior work, our video data is extremely challenging due to low frame rates and visual variability. To tackle the visual challenges, we train a special-purpose signing hand detector using a small subset of our data. Given the hand detector output, a sequence model decodes the hypothesized fingerspelled letter sequence. For the sequence model, we explore attention-based recurrent encoder-decoders and CTC-based approaches. As the first attempt at fingerspelling recognition in the wild, this work is intended to serve as a baseline for future work on sign language recognition in realistic conditions. We find that, as expected, letter error rates are much higher than in previous work on more controlled data, and we analyze the sources of error and effects of model variants.

연구 동기 및 목표

  • 온라인 자료에서 자연스럽게 발생하는 비제어적 영상 데이터에서 미국 수어 손가락 문자 인식의 과제를 해결하기 위해.
  • 실생활 손가락 문자 영상의 가장 큰 공개 데이터셋을 수집하고 배포하여 높은 시각적 변동성과 낮은 프레임 레이트를 반영하기 위해.
  • 비제어적 조건에서 강력한 성능을 내기 위해 전용 서킹 손 감지기와 시퀀스 모델을 조합한 인식 시스템을 개발하고 평가하기 위해.
  • 실제로 '야생' 조건에서의 수어 인식 연구를 위한 기준선을 설정하기 위해.

제안 방법

  • 수집된 데이터의 소량의 서브셋을 기반으로 전용으로 설계된 서킹 손 감지기를 훈련시켜, 복잡하고 저품질의 영상 프레임에서 서킹 손을 국소화한다.
  • 감지된 손 영역은 자르고, s=1의 비율로 확대하여 해상도를 향상시킨 후 시퀀스 모델에 입력한다.
  • 시간에 따른 손자세 시퀀스에서 문자 시퀀스를 디코딩하기 위해 어텐션 기반 인코더-디코더 모델과 Connectionist Temporal Classification (CTC)-기반 모델을 모두 사용하여 시퀀스 모델링을 수행한다.
  • 추가 입력 모odalities로 광학 흐름을 탐색했지만 성능 향상이 유의미하지 않아 최종 모델에서는 사용하지 않는다.
  • 인-house 손가락 문자 시퀀스와 CMUdict를 기반으로 훈련한 언어 모델을 평가하여 그 인식 정확도에 미치는 영향을 분석한다.
  • 빔 크기, 언어 모델 가중치, 삽입 펜alties와 같은 하이퍼파라미터를 개발 세트에서 튜닝하여 디코딩 성능을 최적화한다.

실험 결과

연구 질문

  • RQ1스튜디오 기반 데이터에서 자연스럽게 발생하는 온라인 영상으로의 전환 시 ASL 손가락 문자 인식 성능가 어떻게 저하되는가?
  • RQ2저품질이고 다양한 시각 조건에서 전용으로 제작된 손 감지기가 인식 정확도 향상에 얼마나 기여하는가?
  • RQ3이 도전적인 야생 조건의 손가락 문자 인식 작업에서 CTC와 어텐션 기반 인코더-디코더 중 어떤 시퀀스 모델링 접근 방식이 더 우수한가?
  • RQ4인식 오류의 주요 원인은 무엇이며, 이는 다양한 문자 조합과 영상 품질 수준에 따라 어떻게 달라지는가?
  • RQ5제한된 손가락 문자 데이터로 훈련된 언어 모델이 인식 정확도 향상에 얼마나 기여하는가?

주요 결과

  • CTC 기반 모델이 어텐션 기반 인코더-디코더 모델을 능가하여, 빔 서치, 삽입 펜alty, 언어 모델을 사용할 경우 개발 세트에서 42.8%의 문자 정확도를 달성한다.
  • 가장 흔한 오류 유형은 삭제이며, 그 다음으로 삽입 오류가 많고, 인코더-디코더 모델은 CTC 모델보다 더 많은 삽입 오류와 더 적은 삭제 오류를 기록한다.
  • 일반적인 대체 오류는 외형이 유사한 문자들 사이에서 발생하며, (u → r), (o → e), (y → i), (w → u), (j → i) 등이 포함되며, (j → i) 오류는 낮은 프레임 레이트 영상에서 동적 및 정적 제스처 간의 혼동으로 인한 것으로 보인다.
  • 낮은 프레임 레이트는 인식 정확도를 크게 떨어뜨리며, 영상 품질 악화에 따라 성능이 떨어짐으로써 운동 블러와 시간 해상도의 영향을 잘 보여준다.
  • 언어 모델은 소량의 정확도 향상 기여를 하며, 빔 서치와 삽입 펜alty를 결합했을 때 약 1%의 정확도 향상을 가져온다.
  • 광학 흐름과 화면 확대(s > 1)는 일관되거나 유의미한 성능 향상을 제공하지 않아 최종 모델에서는 더 이상 탐색하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.