[논문 리뷰] Fingerspelling recognition in the wild with iterative visual attention
이 논문은 손 감지 또는 분할을 의존하지 않고 제한되지 않은 실생활 영상에서 미국 수어 손가락 문자를 인식하기 위한 엔드 투 엔드 반복적 시각적 주의 모델을 제안한다. 반복적인 줌 인을 통해 점차 고해상도 관심 영역에 집중함으로써, 이 방법은 기존 작업보다 크게 뛰어난 최신 기술 수준의 정확도를 달성하며, 새로 수집한 대규모 커뮤니티 기반 데이터셋을 조합함으로써 도메인 이동에 대해서도 강건함을 입증한다.
Sign language recognition is a challenging gesture sequence recognition problem, characterized by quick and highly coarticulated motion. In this paper we focus on recognition of fingerspelling sequences in American Sign Language (ASL) videos collected in the wild, mainly from YouTube and Deaf social media. Most previous work on sign language recognition has focused on controlled settings where the data is recorded in a studio environment and the number of signers is limited. Our work aims to address the challenges of real-life data, reducing the need for detection or segmentation modules commonly used in this domain. We propose an end-to-end model based on an iterative attention mechanism, without explicit hand detection or segmentation. Our approach dynamically focuses on increasingly high-resolution regions of interest. It outperforms prior work by a large margin. We also introduce a newly collected data set of crowdsourced annotations of fingerspelling in the wild, and show that performance can be further improved with this additional data set.
연구 동기 및 목표
- 고해상도 배경과 강한 운동 흐림이 있는 실생활 제한되지 않은 영상에서 손가락 문자를 인식하는 데 도전하는 것.
- 통제되지 않은 환경에서 오류가 발생하기 쉬운 손 감지 또는 분할 모듈에 의존하지 않는 것.
- 반복적 주의를 통해 동적으로 고해상도 관심 영역에 집중하는 엔드 투 엔드 모델을 개발하는 것.
- 유튜브 및 청각 장애인 소셜 미디어에서 수집한 YouTube 및 청각 장애인 소셜 미디어에서의 커뮤니티 기반 손가락 문자 주석을 포함한 새로운 대규모 공개 데이터셋을 제공하는 것.
- 반복적 주의가 기존 방법보다 인식 정확도를 크게 향상시키며, 외부 손 감지기와 조합되어도 추가적인 성능 향상을 제공하는지 입증하는 것.
제안 방법
- 모델은 반복적 주의 기반 메커니즘을 사용하여 점차 고해상도 관심 영역에 집중하며, 여러 단계에 걸쳐 서명 중인 손에 대한 집중을 정교화한다.
- 각 반복 단계에서 모델은 입력 프레임의 자르기 영역에 주목하며, 해상도를 높이고 배경 잡음을 줄인다.
- 주의 기반 메커니즘은 손 위치에 대한 명시적 지도 없이 원시 영상 프레임에서 엔드 투 엔드로 훈련된다.
- 안정성과 성능 향상을 위해 얼굴 감지기와 결합되어 관심 영역을 초기화한다.
- 문자열의 순차적 의존성을 모델링하기 위해 언어 모델 헤드를 사용해 모델을 훈련한다.
- 모델은 벤치마크 스튜디오 데이터셋과 새로운 대규모 커뮤니티 기반 실생활 영상 데이터셋을 모두 평가한다.
실험 결과
연구 질문
- RQ1제한되지 않은 영상에서 손 감지나 분할 없이도 엔드 투 엔드 주의 기반 모델이 뛰어난 손가락 문자 인식 정확도를 달성할 수 있는가?
- RQ2표준 주의 또는 고정 크기 자르기 방법에 비해 반복적 시각적 주의의 정확도와 계산 효율성은 어떻게 비교되는가?
- RQ3실생활에서의 대규모 커뮤니티 기반 데이터셋이 다양한 모델의 인식 성능 향상에 얼마나 기여하는가?
- RQ4실생활 파ip라인에서 흔히 사용되는 얼굴 감지 오류에 대해 반복적 주의 모델은 얼마나 강건한가?
- RQ5주의 메커니즘은 정확한 손 위치 추적을 암묵적으로 학습하는가? 그리고 별도로 훈련된 손 감지기와 비교해 볼 때 어떤가?
주요 결과
- 제안된 반복적 주의 모델은 챠카고 FS Wild 테스트 세트에서 61.2%의 문자 정확도를 달성하여 이전 최신 기술 수준의 방법보다 크게 뛰어나다.
- 손 감지기가 존재하는 경우에도 반복적 주의 모델은 상당한 성능 향상을 제공함으로써 감지 기반 접근 방식을 초월하는 추가 가치를 지닌다.
- 반복적 주의를 사용해 훈련된 모델는 동일한 실수율에서 별도로 훈련된 손 감지기(0.223)보다 높은 평균 IoU(0.413)를 기록한다.
- 55,856개의 훈련 시퀀스를 포함하는 커뮤니티 기반의 ChicagoFSWild+ 데이터셋은 모든 테스트 모델에서 성능 향상에 기여한다.
- 모델의 추론 시간은 효율적이며, 평균적으로 1 프레임당 65ms를 차지하여 실시간 응용에 적합하다.
- 인간의 동일한 테스트 세트에서의 성능 범위는 74.3%에서 86.1%이며, 이는 작업이 여전히 도전적이며 현재 기계 성능을 뛰어넘을 여전히 공간이 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.