Skip to main content
QUICK REVIEW

[논문 리뷰] Changing the Representation: Examining Language Representation for Neural Sign Language Production

Harry Walsh, Ben Saunders|arXiv (Cornell University)|2022. 09. 16.
Hand Gesture Recognition Systems인용 수 9
한 줄 요약

이 논문은 언어 표현 방식을 재고함으로써 신경망 기반 수어 생성을 향상시킨다: 구어적 수어 표현 방식인 텍스트-한민노시스(T2H) 번역을 도입하여 어휘 표현이 아닌 구어적 표현을 사용하고, BERT와 Word2Vec을 활용해 문장 수준의 맥락적 임베딩을 생성하며, BPE 및 서브워드 토크나이제이션을 적용하고, 한민노시스에서 유도된 손 모양 정보를 보조 지도로 활용한다. 이 방법은 mDGS에서 BLEU-4 점수 26.99, PHOENIX14T에서 25.09를 기록하여 이전 연구를 크게 능가하는 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Neural Sign Language Production (SLP) aims to automatically translate from spoken language sentences to sign language videos. Historically the SLP task has been broken into two steps; Firstly, translating from a spoken language sentence to a gloss sequence and secondly, producing a sign language video given a sequence of glosses. In this paper we apply Natural Language Processing techniques to the first step of the SLP pipeline. We use language models such as BERT and Word2Vec to create better sentence level embeddings, and apply several tokenization techniques, demonstrating how these improve performance on the low resource translation task of Text to Gloss. We introduce Text to HamNoSys (T2H) translation, and show the advantages of using a phonetic representation for sign language translation rather than a sign level gloss representation. Furthermore, we use HamNoSys to extract the hand shape of a sign and use this as additional supervision during training, further increasing the performance on T2H. Assembling best practise, we achieve a BLEU-4 score of 26.99 on the MineDGS dataset and 25.09 on PHOENIX14T, two new state-of-the-art baselines.

연구 동기 및 목표

  • 저자원 수어 번역 성능 향상을 위해 텍스트-어휘(T2G) 번역을 위한 문장 수준 표현을 개선한다.
  • 수어 번역에서 전통적인 어휘 수준 표현 방식 대비, 한민노시스를 통한 구어적 표현 방식이 성능을 향상시키는지 조사한다.
  • 다양한 토크나이제이션 전략(BPE, WordPiece, 단어, 문자)이 수어 번역 성능에 미치는 영향을 평가한다.
  • 사전 학습된 언어 모델(BERT, Word2Vec)이 저자원 수어 번역에서 개선된 맥락적 문장 임베딩을 제공하는지 탐색한다.
  • 한민노시스에서 유도된 손 모양 정보를 보조 지도로 활용하여 모델 성능을 향상시킨다.

제안 방법

  • 저자들은 수어 번역을 위한 맥락적 문장 임베딩을 생성하기 위해 BERT와 Word2Vec을 적용하여 표현 품질을 향상시킨다.
  • BPE, WordPiece, 단어 수준, 문자 수준 등 다양한 토크나이제이션 방법을 비교하여 저자원 수어 번역에 최적화된 전략을 도출한다.
  • 새로운 텍스트-한민노시스(T2H) 번역 작업을 도입하여, 수어를 초기 설정, 손 모양, 동작을 포함한 구어적 허브르거 표기 체계(HamNoSys)로 표현한다.
  • 한민노시스에서 추출한 손 모양 정보를 학습 중 보조 지도로 활용하여 정렬과 성능 향상을 도모한다.
  • 모델 아키텍처는 양방향 LSTM과 어텐션 메커니즘을 조합하고, 순차적 생성을 위해 교차 엔트로피 손실과 스케줄링 샘플링을 사용한다.
  • 프레임워크는 BLEU-4를 주요 평가 지표로 사용하여 mDGS와 PHOENIX14T 두 가지 벤치마크 데이터셋에서 학습 및 평가된다.

실험 결과

연구 질문

  • RQ1한민노시스와 같은 구어적 표현 방식을 사용할 경우, 어휘 수준 표현 방식 대비 수어 번역 성능이 향상되는가?
  • RQ2BPE, WordPiece, 단어, 문자 중 어떤 토크나이제이션 전략이 저자원 수어 번역에서 가장 높은 성능을 낼 수 있는가?
  • RQ3BERT와 Word2Vec과 같은 사전 학습된 언어 모델이 수어 번역에서 문장 수준의 임베딩을 크게 향상시킬 수 있는가?
  • RQ4한민노시스에서 유도된 손 모양 정보를 보조 지도로 통합할 경우 번역 품질이 향상되는가?
  • RQ5개선된 언어 표현 방식과 토크나이제이션 전략을 활용할 경우, mDGS 및 PHOENIX14T에서 달성 가능한 최신 기술 수준 성능는 무엇인가?

주요 결과

  • 제안된 텍스트-한민노시스(T2H) 접근 방식은 mDGS 데이터셋에서 BLEU-4 점수 26.99를 기록하여 새로운 최신 기술 수준 기준을 설정한다.
  • PHOENIX14T 데이터셋에서는 BLEU-4 점수 25.09를 달성하여 이전 최신 기술 수준 성능(3.17)을 크게 뛰어넘는다.
  • BERT와 Word2Vec 임베딩의 사용은 문장 수준 표현 품질을 향상시켜 저자원 환경에서 번역 품질을 개선한다.
  • BPE 토크나이제이션은 테스트된 전략 중에서 가장 효과적인 것으로 밝혀졌으며, 번역 작업을 단순화하고 일반화 능력을 향상시킨다.
  • 한민노시스에서 유도된 손 모양 정보를 보조 지도로 통합함으로써 성능 향상이 추가로 이루어졌으며, 이는 순차 모델링에서 수어의 구조적 특징이 가치가 있음을 보여준다.
  • 최적의 토크나이제이션, 사전 학습된 임베딩, 그리고 한민노시스를 통한 구어적 표현 방식의 조합은 mDGS 및 PHOENIX14T 데이터셋 모두에 대해 새로운 최신 기술 수준 기준을 설정한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.