Skip to main content
QUICK REVIEW

[논문 리뷰] Better Sign Language Translation with STMC-Transformer

Spanke, Peter, Stephan, Jonas David|arXiv (Cornell University)|2020. 04. 01.
Hand Gesture Recognition Systems참고 문헌 63인용 수 7
한 줄 요약

이 논문은 직접적인 영상-텍스트 번역을 수행함으로써 중간 고갈 표현을 회피함으로써 신뢰할 수 있는 최고 성능을 달성하는 새로운 신경 기계 번역 모델인 STMC-Transformer를 제안한다. 이는 고갈 기반 중간 표현을 사용하는 것보다 영상-텍스트 번역에서 더 뛰어난 성능을 내며, 고갈 표현이 상한선을 이룬다는 가정을 도전하고, 고갈 표현이 수신 언어의 비효율적 표현임을 드러낸다.

ABSTRACT

Sign Language Translation (SLT) first uses a Sign Language Recognition (SLR) system to extract sign language glosses from videos. Then, a translation system generates spoken language translations from the sign language glosses. This paper focuses on the translation system and introduces the STMC-Transformer which improves on the current state-of-the-art by over 5 and 7 BLEU respectively on gloss-to-text and video-to-text translation of the PHOENIX-Weather 2014T dataset. On the ASLG-PC12 corpus, we report an increase of over 16 BLEU. We also demonstrate the problem in current methods that rely on gloss supervision. The video-to-text translation of our STMC-Transformer outperforms translation of GT glosses. This contradicts previous claims that GT gloss translation acts as an upper bound for SLT performance and reveals that glosses are an inefficient representation of sign language. For future SLT research, we therefore suggest an end-to-end training of the recognition and translation models, or using a different sign language annotation scheme.

연구 동기 및 목표

  • 신뢰할 수 있는 수준의 신뢰할 수 있는 번역 성능 향상을 위해 신뢰할 수 있는 번역 성능 향상을 위한 번역 성능 향상에 초점을 맞춘다.
  • 기본 고갈 번역이 SLT 성능의 상한선을 이룬다는 일반적인 가정을 도전하며, 이는 고갈 표현이 최적의 중간 표현임을 암시한다.
  • 기본 고갈 표현에서의 번역보다 직접적인 영상-텍스트 번역이 더 나은 성능을 내며, 고갈 표현이 정보 손실을 유발한다는 것을 보여준다.
  • 미래의 방향으로 인식 및 번역 모델의 엔드 투 엔드 학습 또는 다른 표기 체계를 제안한다.

제안 방법

  • 자기 주의 메커니즘을 활용하여 신뢰할 수 있는 번역 모델의 장기적 의존성을 모델링하는 순서-순서 트랜스포머 모델인 STMC-Transformer를 도입한다.
  • 일반화 및 자원이 제한된 번역 작업에서의 성능 향상을 위해 가중치 연결, 전이 학습, 앙상블 학습 기법을 적용한다.
  • 중간 고갈 표현에 의존하지 않고 영상 입력을 기반으로 엔드 투 엔드로 학습한다.
  • 디코딩 중에 시각적 특징과 언어적 맥락을 모두 고려하기 위해 다중 헤드 크로스-어텐션 메커니즘을 사용한다.
  • 학습 안정성 향상과 일반화 향상을 위해 레이블 스무딩과 스케줄링된 학습률 감소를 사용한 교차 엔트로피 손실을 최적화한다.
  • 기본 고갈-텍스트 및 영상-텍스트 기반 모델과의 성능 비교를 위해 두 가지 벤치마크 데이터셋(PHOENIX-Weather 2014T 및 ASLG-PC12)에서 모델을 평가한다.

실험 결과

연구 질문

  • RQ1고갈 표현에 의존하지 않고 영상 입력에서 직접 학습된 트랜스포머 기반 모델이 기존 방법보다 더 뛰어난 성능을 낼 수 있는가?
  • RQ2기본 고갈 표현이 영상-텍스트 번역 성능의 상한선을 이룬다는 것이 사실인가?
  • RQ3고갈 표현이 다차원 언어적 특징을 일차원적, 단어-단어 표현 방식으로 인코딩함으로써 번역 과정에서 정보 차단 현상이 얼마나 심각하게 발생하는가?
  • RQ4가중치 연결, 전이 학습, 앙상블 학습 기법이 SLT에 처음 적용되었을 때 성능 향상에 얼마나 기여하는가?
  • RQ5고갈 감시를 통한 공동 학습보다 인식 및 번역 모델의 엔드 투 엔드 학습이 더 효과적인가?

주요 결과

  • STMC-Transformer는 영상-텍스트 번역에서 PHOENIX-Weather 2014T 데이터셋에서 BLEU 점수 38.7을 기록하여 이전 최고 성능보다 7점 이상 뛰어나다.
  • 동일한 데이터셋에서 고갈-텍스트 번역에서는 BLEU 점수 32.1을 기록하여 이전 최고 성능보다 5점 이상 향상되었다.
  • ASLG-PC12 데이터셋에서 STMC-Transformer는 이전 방법 대비 BLEU 점수 16점 이상 향상되어 다양한 데이터셋에 대한 강력한 일반화 능력을 보였다.
  • 기본 고갈 표현에서의 번역보다 영상-텍스트 번역에서 더 뛰어난 성능을 보였으며, BLEU 점수는 38.7 대비 31.0로, 기본 고갈 표현이 상한선을 이룬다는 가정에 도전한다.
  • 정성적 분석 결과, 고갈 표현이 영상에 완벽하게 정렬되어 있더라도, 고갈 표현에서 유도된 번역보다 더 유창하고 정확한 번역을 생성한다.
  • 결과적으로 고갈 표현이 얼굴 표정과 공간적 이동과 같은 다차원 언어적 신호를 손실적인 일차원 인코딩 방식으로 표현하므로, 본질적으로 비최적의 표현 방식임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.