Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Modal Zero-Shot Sign Language Recognition

Razieh Rastgoo, Kourosh Kiani|arXiv (Cornell University)|2021. 09. 02.
Hand Gesture Recognition Systems참고 문헌 39인용 수 4
한 줄 요약

이 논문은 C3D와 뼈대 기반 특징(거리, 각도, SVD)에서 유도된 깊이 특징과 뼈대 기반 특징을 자동에코와 LSTM을 통해 융합하는 임베딩 기반의 다중모달, 하이브리드 특징, 제로샷 수어 인식 모델을 제안한다. 이 모델은 BERT 임bedded 클래스 레이블로 매핑하여 네 개의 대규모 데이터셋에서 최신 기술 수준의 성능을 달성한다. 이는 새로운 수어 클래스를 위한 눈에 띄는 시각적 예시 없이도 효과적으로 처리할 수 있음을 보여주며, 다중모달 융합을 통해 뛰어난 내구성과 일반화 능력을 입증한다.

ABSTRACT

Zero-Shot Learning (ZSL) has rapidly advanced in recent years. Towards overcoming the annotation bottleneck in the Sign Language Recognition (SLR), we explore the idea of Zero-Shot Sign Language Recognition (ZS-SLR) with no annotated visual examples, by leveraging their textual descriptions. In this way, we propose a multi-modal Zero-Shot Sign Language Recognition (ZS-SLR) model harnessing from the complementary capabilities of deep features fused with the skeleton-based ones. A Transformer-based model along with a C3D model is used for hand detection and deep features extraction, respectively. To make a trade-off between the dimensionality of the skeletonbased and deep features, we use an Auto-Encoder (AE) on top of the Long Short Term Memory (LSTM) network. Finally, a semantic space is used to map the visual features to the lingual embedding of the class labels, achieved via the Bidirectional Encoder Representations from Transformers (BERT) model. Results on four large-scale datasets, RKS-PERSIANSIGN, First-Person, ASLVID, and isoGD, show the superiority of the proposed model compared to state-of-the-art alternatives in ZS-SLR.

연구 동기 및 목표

  • 새로운 클래스에 대한 시각적 예시가 전혀 필요 없는 제로샷 인식을 가능하게 하여 수어 인식 분야에서의 레이블링 병목 현상을 해결하고자 한다.
  • RGB 비디오, 3D 뼈대, 텍스트 기술 등의 상보적인 다중모달 입력을 활용하여 수어 인식의 내구성과 일반화 능력을 향상시키고자 한다.
  • 수작업 뼈대 특징(거리, 각도, SVD)과 C3D 네트워크에서 유도된 깊이 특징을 조합한 하이브리드 특징 표현 방식을 개발하고자 한다.
  • 시각적 특징의 차원 균형과 표현 학습을 향상시키기 위해 LSTM 인코더 위에 자동에코를 적용하여 특징 차원을 감소시키고 균형을 맞추고자 한다.
  • 제로샷 일반화를 위해 시각적 특징을 BERT 임베딩된 클래스 레이블과 공유된 의미 공간에 매핑하고자 한다.

제안 방법

  • 실시간 정확한 손 감지 성능을 향상시켜 수어 인식의 입력 품질을 향상시키기 위해 트랜스포머 기반 모델을 구성한다.
  • RGB 비디오에서 사전 훈련된 C3D 3D CNN 모델을 사용해 깊이 특징을 추출하고, 3D 자세 데이터에서 뼈대 특징(거리, 관절 각도, 관절 위치의 SVD)을 계산한다.
  • LSTM에 임bed된 깊이 특징에 자동에코를 적용하여 차원을 감소시키고 뼈대 특징과 특징 공간의 균형을 맞춘다.
  • 융합된 시각적 특징(깊이 + 뼈대)을 대비 학습 목표를 통해 BERT 임베딩된 클래스 레이블과 정렬된 공유 의미 공간으로 투영한다.
  • 제로샷 일반화를 가능하게 하기 위해 RGB 비디오, 3D 뼈대 시퀀스, 수어 레이블의 텍스트 기술을 통합한 다중모달 입력 파이프라인을 사용한다.
  • 네 개의 대규모 데이터셋(RKS-PERSIANSIGN, First-Person, ASLVID, isoGD)을 사용하여 새로운 수어 클래스에 대한 성능을 검증하기 위해 이중 단계 평가 프로토콜을 적용한다.

실험 결과

연구 질문

  • RQ1깊이 특징과 뼈대 기반 특징을 융합하는 다중모달, 하이브리드 특징 접근 방식이 제로샷 수어 인식 성능을 향상시키는가?
  • RQ2BERT 임베딩된 텍스트 기술을 활용해 시각적 특징을 공유 의미 공간으로 매핑하는 것이 제로샷 일반화에 얼마나 효과적인가?
  • RQ3트랜스포머 기반 손 감지 모델의 통합이 자원이 제한된 환경에서 수어 인식의 내구성과 정확도를 향상시키는가?
  • RQ4자기에코를 통한 특징 차원 균형 조정이 제로샷 수어 인식에서 모델 성능과 일반화 능력을 얼마나 향상시키는가?
  • RQ5다양한 수어 데이터셋에서 최신 기술 수준의 방법과 비교해 본다면, 제안된 모델은 제로샷 정확도와 내구성 측면에서 어떤가?

주요 결과

  • 제안된 모델은 네 개의 대규모 수어 인식 데이터셋(RKS-PERSIANSIGN, First-Person, ASLVID, isoGD)에서 최신 기술 수준의 성능을 달성하며, 기존 최신 기술 수준의 방법들을 초월한다.
  • 훈련 중에 눈에 띄는 시각적 예시 없이도 텍스트 기술만을 사용하여 새로운 수어 클래스를 인식함으로써 뛰어난 일반화 능력을 입증한다.
  • C3D에서 유도된 깊이 특징과 뼈대 기반 특징(거리, 각도, SVD)의 융합은 복잡하거나 모호한 수어 카테고리에서 특히 정확도 향상에 기여한다.
  • 깊이 특징과 뼈대 특징의 차원 균형을 맞추기 위해 자동에코를 사용함으로써 더 안정적이고 효과적인 특징 표현 학습이 가능해진다.
  • RKS-PERSIANSIGN에서 평균 정확도 >0.7(각 수어당)를 기록하며 ASLVID보다 높은 인식 정확도를 보이며, '자매' vs '형제', '악어' vs '요트'와 같은 어려운 수어는 일반적으로 오분류의 원인이 된다.
  • 다중모달 상보성 덕분에 오류가 발생할 경우 다른 모달이 보완함으로써 잘못된 분류를 줄이고, 특정 특징 유형에 대한 편향을 줄여 내구성을 높인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.