Skip to main content
QUICK REVIEW

[논문 리뷰] Progressive Transformers for End-to-End Sign Language Production

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|2020. 04. 30.
Hand Gesture Recognition Systems참고 문헌 66인용 수 13
한 줄 요약

이 논문은 말하는 언어를 직접 3D 수어 자세 시퀀스로 번역하는 최초의 엔드 투 엔드 모델인 프로그레시브 트랜스포머를 제안한다. 이는 명시적인 종료 시퀀스 토큰 없이도 가변 길이의 연속 시퀀스를 생성할 수 있도록 카운터 디코딩 메커니즘을 도입하여, PHOENIX14-T 데이터셋에서 BLEU-4 점수 9.94를 기록하며 최신 기술 수준을 달성했으며, 어휘 중간 표현을 사용하는 모델보다 뛰어난 성능을 보였다.

ABSTRACT

The goal of automatic Sign Language Production (SLP) is to translate spoken language to a continuous stream of sign language video at a level comparable to a human translator. If this was achievable, then it would revolutionise Deaf hearing communications. Previous work on predominantly isolated SLP has shown the need for architectures that are better suited to the continuous domain of full sign sequences. In this paper, we propose Progressive Transformers, a novel architecture that can translate from discrete spoken language sentences to continuous 3D skeleton pose outputs representing sign language. We present two model configurations, an end-to-end network that produces sign direct from text and a stacked network that utilises a gloss intermediary. Our transformer network architecture introduces a counter that enables continuous sequence generation at training and inference. We also provide several data augmentation processes to overcome the problem of drift and improve the performance of SLP models. We propose a back translation evaluation mechanism for SLP, presenting benchmark quantitative results on the challenging RWTH-PHOENIX-Weather-2014T(PHOENIX14T) dataset and setting baselines for future research.

연구 동기 및 목표

  • 고립된 수어 생성의 한계를 극복하고, 말하는 언어 텍스트에서 연속적인 수어 영상 생성을 위한 엔드 투 엔드 모델을 개발하는 것.
  • 고정된 어휘나 명시적인 종료 시퀀스 토큰에 의존하지 않고도 가변 길이의 연속적인 3D 자세 시퀀스를 생성하는 도전 과제를 해결하는 것.
  • 새로운 데이터 증강 기법을 통해 모델의 안정성을 향상시키고 자세 생성 시의 드리프트를 감소시키는 것.
  • 백번역을 사용한 수어 언어 생성을 위한 벤치마크 평가 프로토콜을 수립하는 것.
  • 직접적인 텍스트에서 자세로의 번역이 어휘 중간 표현을 사용하는 방법보다 우수하며, 고비용의 어휘 애너테이션에 대한 의존도를 줄일 수 있음을 입증하는 것.

제안 방법

  • 사전에 정의된 어휘나 EOS 토큰이 필요 없이 연속적인 가변 길이의 출력을 가능하게 하는 시퀀스 생성 진척도를 추적하는 카운터 디코딩 메커니즘을 도입한다.
  • 입력 텍스트와 출력 자세 시퀀스 양쪽에서 장거리 의존성을 모델링하기 위해 다중 헤드 어텐션을 활용한 프로그레시브 트랜스포머 아키텍처를 사용한다.
  • 모델 드리프트 감소와 일반화 능력 향상을 위해 무작위 크롭, 시간 스케일링, 노이즈 주입 등의 데이터 증강 기법을 적용한다.
  • 학습된 수어 번역(SLT) 모델이 생성된 수어 자세를 다시 텍스트로 번역하는 백번역 평가 프로토콜을 사용하여 자동으로 평가 지표를 계산한다.
  • 모델 구성 두 가지를 구현한다: T2P(텍스트에서 자세로) 및 T2G2P(텍스트에서 어휘를 거쳐 자세로), 어휘 중간 표현의 영향을 분석할 수 있도록 한다.
  • 훈련 및 평가에 사용된 3D 자세 시퀀스는 RWTH-PHOENIX-Weather-2014 T 데이터셋에서 확보하였으며, 출력 표현으로는 공동 좌표를 사용한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 고정된 어휘나 EOS 토큰 없이도 말하는 언어 텍스트에서 연속적인 3D 수어 자세 시퀀스를 생성할 수 있는가?
  • RQ2직접적인 엔드 투 엔드 텍스트에서 자세로의 번역이 수어 생성에서 어휘를 중간 표현으로 사용하는 모델보다 우수한가?
  • RQ3데이터 증강 기법이 자세 생성 시의 드리프트 감소와 시퀀스 품질 향상에 어느 정도 기여하는가?
  • RQ4백번역 평가 메커니즘이 수어 언어 생성을 위한 신뢰성 있고 재현 가능한 벤치마크 결과를 제공할 수 있는가?
  • RQ5다른 모델 구성(T2P 대 T2G2P)은 생성된 수어 시퀀스의 현실성과 정확성에 어떤 영향을 미치는가?

주요 결과

  • 어휘를 중간 표현으로 사용하지 않고 직접 텍스트에서 자세로 번역하는 T2P 모델이 어휘 중간 표현을 사용하는 T2G2P 모델보다 우수하여, PHOENIX14-T 데이터셋에서 BLEU-4 점수 9.94를 기록했다.
  • 제안된 카운터 디코딩 메커니즘은 명시적인 종료 토큰 없이도 안정적이고 연속적인 시퀀스 생성을 가능하게 하여 추론의 신뢰도를 향상시켰다.
  • 데이터 증강 기법이 모델 드리프트를 크게 감소시켜 생성 과정에서 더 정확하고 안정적인 수어 자세 시퀀스를 생성하도록 했다.
  • 백번역 평가 프로토콜은 인간 평가가 필요 없이도 수어 언어 생성을 위한 신뢰할 수 있는 자동 벤치마크를 제공하여 다양한 모델 간 비교를 가능하게 했다.
  • 정성적 결과에서는 모델이 매끄럽고 현실적인 수어 시퀀스를 생성하며 신체 운동과 의미 있는 손 자세를 정확히 구현하는 것으로 나타났지만, 고유명사는 여전히 도전 과제로 남아 있었다.
  • 모델은 어휘 애너테이션 없이도 고품질의 수어 언어 생성이 가능하다는 것을 입증하여, 저자원 수어 분야에 대한 SLP의 적용 가능성을 넓혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.