Skip to main content
QUICK REVIEW

[논문 리뷰] Sign Language Transformers: Joint End-to-end Sign Language Recognition and Translation

Necati Cihan Camgöz, Oscar Koller|arXiv (Cornell University)|2020. 03. 30.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

이 논문은 CTC 손실을 통해 어휘 수준의 감독을 제공하는 트랜스포머 기반 모델을 사용하여 연속적 수어 인식(CSLR)과 수어 번역(SLT)을 동시에 수행하는 통합 엔드투엔드 아키텍처인 Sign Language Transformers를 제안한다. 이 방법은 PHOENIX14 T 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 일부 경우에서 BLEU-4 점수를 두 배 이상 높여 21.80 대비 9.58을 기록했고, 직접 영상 표현에서 번역함으로써 텍스트 기반 번역 베이스라인을 초월한다.

ABSTRACT

Prior work on Sign Language Translation has shown that having a mid-level sign gloss representation (effectively recognizing the individual signs) improves the translation performance drastically. In fact, the current state-of-the-art in translation requires gloss level tokenization in order to work. We introduce a novel transformer based architecture that jointly learns Continuous Sign Language Recognition and Translation while being trainable in an end-to-end manner. This is achieved by using a Connectionist Temporal Classification (CTC) loss to bind the recognition and translation problems into a single unified architecture. This joint approach does not require any ground-truth timing information, simultaneously solving two co-dependant sequence-to-sequence learning problems and leads to significant performance gains. We evaluate the recognition and translation performances of our approaches on the challenging RWTH-PHOENIX-Weather-2014T (PHOENIX14T) dataset. We report state-of-the-art sign language recognition and translation results achieved by our Sign Language Transformers. Our translation networks outperform both sign video to spoken language and gloss to spoken language translation models, in some cases more than doubling the performance (9.58 vs. 21.80 BLEU-4 Score). We also share new baseline translation results using transformer networks for several other text-to-text sign language translation tasks.

연구 동기 및 목표

  • 중간 단계의 어휘 애너테이션을 버티고서도 수어 인식과 번역을 위한 통합 엔드투엔드 학습에 도전하는 것.
  • 통합 트랜스포머 아키텍처 내에서 CTC 손실을 통한 인식 감독을 활용하여 번역 성능을 향상시키는 것.
  • 명시적인 어휘 토크나이제이션 또는 별도의 인식 단계가 필요 없도록 하여 영상에서 직접 음성 언어로의 번역을 가능하게 하는 것.
  • 통합 학습이 동시에 두 작업의 성능 향상에 기여함을 보여주는 것.
  • 다양한 데이터셋에서 트랜스포머 기반 모델을 사용하여 수어 번역의 새로운 SOTA 기준을 설정하는 것.

제안 방법

  • 수어 영상 시퀀스를 처리하고 말 언어 번역을 생성하기 위해 트랜스포머 기반 인코더-디코더 아키텍처를 사용한다.
  • 인코더에 연결주의 시간 분류(CTC) 손실을 적용하여 정확한 타이밍 애너테이션 없이도 어휘 수준의 감독을 제공한다.
  • 모델은 하나의 엔드투엔드 학습 과정에서 수어 인식과 번역을 동시에 최적화한다.
  • 공간적 특징은 3D CNN 백본을 통해 추출되며, 시간적 모델링은 트랜스포머 인코더와 디코더가 담당한다.
  • 일반적인 ImageNet 기반 특징보다는 수어 데이터 기반 사전 훈련된 특징을 사용하여 표현 학습을 향상시킨다.
  • 디코더는 인코딩된 수어 특징을 조건으로 삼아 자동회귀 생성 방식으로 말 언어 출력 토큰을 하나씩 생성한다.

실험 결과

연구 질문

  • RQ1중간 어휘 애너테이션 없이도 통합 트랜스포머 아키텍처가 엔드투엔드 방식으로 수어 인식과 번역을 동시에 학습할 수 있는가?
  • RQ2트랜스포머 인코더에 CTC 손실을 통합하면 인식 및 번역 성능이 향상되는가?
  • RQ3중간 어휘 표현에 의존하는 기존 텍스트 기반 번역 베이스라인보다 직접 영상에서 음성 언어로의 번역이 성능이 뛰어나지 않는가?
  • RQ4일반적인 ImageNet 특징에 비해 사전 훈련된 수어 전용 특징은 수어 표현 학습에 얼마나 더 효과적인가?
  • RQ5인식과 번역의 통합 학습이 두 작업의 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 Sign Language Transformers는 PHOENIX14 T 데이터셋에서 최신 기술 수준 성능을 달성하며, BLEU-4 점수 21.80을 기록하여 이전 방법들(예: 이전 연구에서의 9.58 BLEU-4)을 크게 능가한다.
  • 이전에는 가상의 상한선으로 여겨졌던 텍스트 기반 번역 베이스라인을 뛰어넘어, 직접 수어 영상에서 말 언어로의 번역을 수행함으로써 성능을 초월한다.
  • 인식과 번역의 통합 학습은 두 작업 모두 성능 향상에 기여함을 보여주며, 이 두 문제 간의 상호의존성을 입증한다.
  • 일반적인 ImageNet 기반 특징보다 수어 전용 데이터 기반 사전 훈련 특징이 더 나은 표현을 제공함으로써, 인식 및 번역 정확도가 향상된다.
  • 복잡한 문법적 구조에 대해서도 잘 일반화되어 있으며, 명사어 및 숫자 표현과 같은 도전 과제가 있음에도 불구하고 문법적으로 올바르고 의미적으로 정확한 번역을 생성한다.
  • 제거 실험을 통해 CTC 감독이 인식 품질을 크게 향상시키며, 이는 번역 성능 향상으로 이어지는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.