[논문 리뷰] Zero-Shot Sign Language Recognition: Can Textual Data Uncover Sign Languages?
이 논문은 비정형 영상 학습 예제가 전혀 없는 상황에서도 새로운 서브클래스를 인식할 수 있도록 하는 제로샷 수어 인식(ZSSLR)을 소개한다. 수어 사전의 텍스트 기술을 활용하여 시각적 특징과 텍스트 기술 간의 일치를 도모하는 프레임워크를 제안한다. 신체 및 손 부위의 시공간적 특징을 3D-CNN과 양방향 LSTM을 통해 모델링하고, 적합도 함수를 통해 시각적 임베딩을 텍스트 기술 공간에 정렬함으로써, 새로운 ASL-Text 벤치마크에서 상위 1위 정확도 20.9%를 달성하여 텍스트 데이터를 활용한 제로샷 수어 이해의 가능성을 입증한다.
We introduce the problem of zero-shot sign language recognition (ZSSLR), where the goal is to leverage models learned over the seen sign class examples to recognize the instances of unseen signs. To this end, we propose to utilize the readily available descriptions in sign language dictionaries as an intermediate-level semantic representation for knowledge transfer. We introduce a new benchmark dataset called ASL-Text that consists of 250 sign language classes and their accompanying textual descriptions. Compared to the ZSL datasets in other domains (such as object recognition), our dataset consists of limited number of training examples for a large number of classes, which imposes a significant challenge. We propose a framework that operates over the body and hand regions by means of 3D-CNNs, and models longer temporal relationships via bidirectional LSTMs. By leveraging the descriptive text embeddings along with these spatio-temporal representations within a zero-shot learning framework, we show that textual data can indeed be useful in uncovering sign languages. We anticipate that the introduced approach and the accompanying dataset will provide a basis for further exploration of this new zero-shot learning problem.
연구 동기 및 목표
- 실제 적용 환경에서 흔히 발생하는, 정합된 시각적 학습 예제가 전혀 없는 상황에서 수어 클래스를 인식하는 데 도전하는 것.
- 사용 가능한 수어 사전의 텍스트 기술이 제로샷 수어 인식을 위한 효과적인 의미적 사전 지식으로 기능할 수 있는지 탐색하는 것.
- ZSSLR 연구를 위한 새로운 벤치마크 데이터셋인 ASL-Text를 구축하여 250개의 수어 클래스와 해당 텍스트 정의를 포함하는 것.
- 시공간적 시각 표현과 텍스트 임베딩을 융합하여 제로샷 일반화를 위한 엔드 투 엔드 학습 가능한 프레임워크를 개발하는 것.
- 장기적인 시간적 의존성을 모델링하기 위해 다양한 RNN 아키텍처와 특징 융합 전략의 성능을 평가하는 것.
제안 방법
- 프레임워크는 3D-컨볼루션 신경망(3D-CNNs)을 사용하여 영상 클립의 시공간적 특징을 추출하며, 손과 전체 신체 부위에 집중한다.
- 장기적인 시간적 의존성을 모델링하기 위해 양방향 장기 단기 기억망(bi-LSTM) 네트워크를 적용한다.
- 웹스터 미국 수어 사전에서 제공하는 텍스트 기술을 사전에 학습된 단어 임베딩을 사용하여 임베딩 처리하여 수어 클래스의 의미적 표현을 형성한다.
- 적합도 함수를 학습시켜 시각적 임베딩을 텍스트 임베딩 공간으로 매핑함으로써, 최근접 이웃 검색을 통한 제로샷 예측을 가능하게 한다.
- 대비 손실을 사용하여 시각적 특징과 해당 텍스트 기술 간의 정렬을 위해 엔드 투 엔드로 모델을 학습시킨다.
- 손과 신체 스트림의 특징을 bi-LSTM 레이어 이전에 연결하여 융합함으로써, 분류 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1수어 사전의 텍스트 기술이 새로운 수어 클래스를 인식하기 위한 의미적 사전 지식으로 효과적으로 기능할 수 있는가?
- RQ23D-CNN + 양방향 LSTMs 아키텍처는 제로샷 인식을 위한 수어 영상의 시공간적 동역학을 얼마나 잘 모델링하는가?
- RQ3손과 신체 영역의 특징을 모두 통합하면 단일 모odal 사용에 비해 제로샷 수어 인식 성능을 향상시키는가?
- RQ4LSTM, GRU, 양방향 LSTMs 등의 다양한 RNN 아키텍처는 제로샷 인식 프레임워크 성능에 어떤 영향을 미치는가?
- RQ5텍스트 기술의 품질이 ZSSLR 모델의 일반화 능력에 어느 정도 영향을 미치는가?
주요 결과
- 제안된 프레임워크는 ASL-Text 벤치마크에서 상위 1위 정규화 정확도 20.9%와 상위 5위 정규화 정확도 51.4%를 달성하여 무작위 기준선(각각 2.0% 및 10.0%)을 크게 앞서간다.
- 양방향 LSTMs의 사용이 RNN 변종 중에서 가장 높은 성능을 보였으며, 상위 1위 정확도 20.9%와 상위 5위 정확도 51.4%를 기록했다.
- 손과 신체 영역의 특징을 융합하면 단일 모달 사용에 비해 성능 향상이 이루어졌으며, 병합된 스트림은 상위 1위 정확도 20.9%를 달성했다.
- 특징 감소에 LLE(Locality-Linear Embedding)를 사용할 경우 평균 풀링 및 기타 기준선에 비해 성능이 뛰어났다.
- 오류 예측의 대부분은 수어 기술 간 높은 의미적 또는 시각적 유사성에서 기인하여, 더 세밀한 표현 학습이 필요함을 시사한다.
- 전문가가 정의한 사전의 텍스트 데이터가 제로샷 수어 인식을 위한 유효하고 효과적인 지식 원천이 될 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.