Skip to main content
QUICK REVIEW

[논문 리뷰] MS-ASL: A Large-Scale Data Set and Benchmark for Understanding American Sign Language

Hamid Reza Vaezi Joze, Oscar Koller|arXiv (Cornell University)|2018. 12. 03.
Hand Gesture Recognition Systems참고 문헌 77인용 수 146
한 줄 요약

이 논문은 222명의 서명인과 1000 글자(Gloss)로 구성된 대규모 ASL 데이터셋 MS-ASL을 소개하고, 2D/3D CNN, 바디-키포인트 스트림, 및 I3D를 사용한 베이스라인을 확립하며, I3D가 가장 강력한 성능을 보인다는 것을 보여준다. 또한 분류 클래스 수와 샘플 크기가 인식 정확도에 미치는 영향을 분석한다.

ABSTRACT

Sign language recognition is a challenging and often underestimated problem comprising multi-modal articulators (handshape, orientation, movement, upper body and face) that integrate asynchronously on multiple streams. Learning powerful statistical models in such a scenario requires much data, particularly to apply recent advances of the field. However, labeled data is a scarce resource for sign language due to the enormous cost of transcribing these unwritten languages. We propose the first real-life large-scale sign language data set comprising over 25,000 annotated videos, which we thoroughly evaluate with state-of-the-art methods from sign and related action recognition. Unlike the current state-of-the-art, the data set allows to investigate the generalization to unseen individuals (signer-independent test) in a realistic setting with over 200 signers. Previous work mostly deals with limited vocabulary tasks, while here, we cover a large class count of 1000 signs in challenging and unconstrained real-life recording conditions. We further propose I3D, known from video classifications, as a powerful and suitable architecture for sign language recognition, outperforming the current state-of-the-art by a large margin. The data set is publicly available to the community.

연구 동기 및 목표

  • 대 unconstrained, real-life recordings에서 딥 러닝을 가능하게 하기 위한 대규모의 서명인 독립 ASL 데이터셋을 만든다.
  • RGB 비디오 만으로 ASL 인식을 위한 다중 아키텍처에 걸친 철저한 베이스라인을 제공한다.
  • 다양하고 대규모 어휘 데이터셋에서 ASL 인식에 대한 I3D의 효과를 입증한다.
  • 클래스 수와 클래스당 샘플 수가 인식 성능에 미치는 영향을 분석한다.

제안 방법

  • 공개적으로 이용 가능한 ASL 비디오에서 자동화 및 수작업 라벨링을 통해 MS-ASL의 1000 Gloss를 222명의 서명인으로 구성된 대규모 ASL 데이터셋을 Assemble한다.
  • RGB 입력과 고정 프레임 윈도우를 사용하여 2D-CNN+LSTM, 바디-키포인트 스트림, 3D-CNN 아키텍처에 걸친 베이스라인을 평가한다.
  • 강력한 베이스라인으로 I3D (inflated 3D ConvNet)를 채택하고 기존 최첨단 방법과 비교한다.
  • 각 세트에 서로 다른 서명인을 포함한 학습/검증/테스트 분할을 설계하여 서명인 독립성을 도입한다.
  • 향후 연구에 사용할 MS-ASL에서 사전 학습된 도메인 내 I3D 모델을 제공한다.

실험 결과

연구 질문

  • RQ11000개의 서명인 독립 대규모 ASL 데이터셋이 unconstrained real-life 비디오에서 효과적인 딥 러닝 기반 인식이 가능하게 하는가?
  • RQ2MS-ASL에서 가장 강력한 베이스라인 성능을 제공하는 아키텍처는 무엇인가(2D-CNN+LSTM, 바디 키포인트, 3D-CNN, I3D)?
  • RQ3클래스 수 증가와 클래스당 샘플 수 증가가 인식 정확도에 어떤 영향을 미치는가?
  • RQ4MS-ASL에서 사전 학습된 모델과 도-domain 사전 학습의 차이가 ASL 인식에 어떤 영향을 미치는가?

주요 결과

  • I3D는 모든 하위집합에서 최강의 클래스별 정확도를 달성하며, 예를 들어 ASL1000에서 상위-5 정확도는 57.69%, ASL1000에서의 상위-5 정확도는 81.08%이다.
  • 바디-키포인트 기반 HCN은 2D-CNN 베이스라인보다 향상되지만 I3D에는 미치지 못하여 손/손가락 표현에 개선의 여지가 있음을 시사한다.
  • 이 데이터셋에서 단일 프레임 컨텍스트가 제한되고 변화성이 커 베이스라인 2D-CNN의 성능이 낮다.
  • MS-ASL에서의 도메인 내 사전 학습은 성능을 크게 향상시키며(예: I3D가 ASL100에서 도메인 내 사전 학습 시 클래스를 기준으로 85.32%에 도달하는 반면 ASL100에서 83.36%일 때),
  • 클래스 수가 늘어나면 학습/테스트에서 정확도가 감소하지만 클래스당 샘플 수가 늘어나면 이 감소를 완화한다; 데이터가 더 많을수록 이 영향은 작아진다.
  • 학습 샘플이 더 많아질수록 정확도가 향상되며, 특히 샘플이 40개 미만인 클래스에서 큰 향상이 나타난다; 그 이상에서는 심볼의 모호성도 성능에 영향을 준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.