Skip to main content
QUICK REVIEW

[논문 리뷰] Everybody Sign Now: Translating Spoken Language to Photo Realistic Sign Language Video

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|2020. 11. 19.
Hand Gesture Recognition Systems참고 문헌 65인용 수 36
한 줄 요약

SignGAN은 먼저 Transformer+MDN으로 골격 자세를 생성한 다음 컨트롤 가능한 다중 서명자 스타일과 손 중심의 키포인트 손실을 갖춘 사진 실사 같은 서명자 영상으로 음성을 번역합니다.

ABSTRACT

To be truly understandable and accepted by Deaf communities, an automatic Sign Language Production (SLP) system must generate a photo-realistic signer. Prior approaches based on graphical avatars have proven unpopular, whereas recent neural SLP works that produce skeleton pose sequences have been shown to be not understandable to Deaf viewers. In this paper, we propose SignGAN, the first SLP model to produce photo-realistic continuous sign language videos directly from spoken language. We employ a transformer architecture with a Mixture Density Network (MDN) formulation to handle the translation from spoken language to skeletal pose. A pose-conditioned human synthesis model is then introduced to generate a photo-realistic sign language video from the skeletal pose sequence. This allows the photo-realistic production of sign videos directly translated from written text. We further propose a novel keypoint-based loss function, which significantly improves the quality of synthesized hand images, operating in the keypoint space to avoid issues caused by motion blur. In addition, we introduce a method for controllable video generation, enabling training on large, diverse sign language datasets and providing the ability to control the signer appearance at inference. Using a dataset of eight different sign language interpreters extracted from broadcast footage, we show that SignGAN significantly outperforms all baseline methods for quantitative metrics and human perceptual studies.

연구 동기 및 목표

  • 청각 장애 커뮤니티가 truly 이해할 수 있는 포토-리얼리스틱 수화 생산(SLP)의 필요성에 대해 동기 부여합니다.
  • 연속 수화 자세로 음성을 번역한 다음 고품질 서명자 영상으로 이어지는 공동 파이프라인을 제안합니다.
  • novel losses와 제어 가능한 생성으로 손 이미지 품질과 서명자 변동성을 다룹니다.
  • 포즈(content)와 스타일(signer appearance)을 분리하여 다양한 데이터셋에서 학습 가능하게 합니다.
  • 백-번역 및 지각(metrics)에서 베이스라인과 비교하여 개선점을 보여줍니다.

제안 방법

  • Mixture Density Network(MDN)을 갖춘 Transformer 기반의 연속 수화 생성 모듈을 사용하여 음성으로 조건화된 다중 모달 포즈 분포를 모델링합니다.
  • 생성된 수화 포즈를 열지도(heat-map) 표현으로 변환하여 비디오 합성 네트워크를 조건화합니다.
  • 포즈-조건화된 비디오-투-비디오 합성 모듈을 다중 스케일 GAN(G, D1–D3)로 구현하여 사진 실사 같은 서명자 비디오를 생성하고, U-Net 스타일의 스킵 연결을 사용합니다.
  • 사전 학습된 손 포즈 추정기를 사용한 손 키포인트 손실을 도입해 키포인트 공간에서 손 영역을 감독하고 손 합성의 모션 블러를 완화합니다.
  • 서명자 스타일 이미지로 조건화해 추론 시 다중 서명자 출력과 외관 제어를 가능하게 하여 제어 가능한 비디오 생성을 구현합니다.
  • 적대적 손실, 특징-일치 손실, 지각 손실과 시간적 일관성 손실을 총 목적 함수 L_Total에 결합해 비디오 합성을 수행합니다.
  • 데이터 품질 차이를 활용하기 위해 SLP(PHOENIX14T)와 서명자 비디오 생성을 각각 다른 데이터셋에서 학습하여 콘텐츠(포즈)와 스타일(서명자 외관)의 분리를 수행합니다.

실험 결과

연구 질문

  • RQ1단일 엔드-투-엔드 파이프라인이 서명자의 정체성과 외관을 보존하면서 음성을 포토-리얼리스틱 수화 영상으로 번역할 수 있는가?
  • RQ2MDN 기반의 다중 모달 포즈 모델 도입이 결정론적 접근보다 연속 수화 생성을 향상시키는가?
  • RQ3포즈-조건화된 제어 가능한 서명자 생성이 지각적 현실감 및 다중 서명자 간의 일관성을 개선하는가?
  • RQ4손 키포인트 기반 손실이 손 품질을 개선하고 손에서의 흐림을 줄이는가?
  • RQ5SignGAN이 백-번역 및 지각 연구에서 최신 베이스라인 대비 어떤 성능 차이를 보이는가?

주요 결과

  • SignGAN은 PHOENIX14T 데이터셋의 Text to Pose 번역에서 백-번역 BLEU-4에서 최상위 성능을 달성했습니다(테스트 세트에서 12.18).
  • SignGAN은 포즈-조건화 서명자 생성에서 단일 및 다중 서명자 데이터셋 모두에서 모든 지표(SSIM, Hand SSIM, Hand Pose 거리, FID)에서 베이스라인을 능가합니다.
  • 손 키포인트 손실은 표준 손 판별기와 비교해 손 영역 품질과 Hand SSIM을 크게 향상시켰습니다.
  • 다중 서명자 스타일로 제어 가능한 생성은 더 나은 SSIM 및 FID를 달성하고 사용자 연구에서 지각 선호도를 향상시켰습니다.
  • MDN 기반의 다중 모달 포즈 모델링은 회귀-중앙화(regression-to-the-mean)를 줄이고 결정론적 접근보다 더 표현력 있는 수화 포즈 시퀀스를 생성합니다.
  • 주관적 지각 연구에서 SignGAN은 단일 및 다중 서명자 설정 모두에서 베이스라인보다 선호도가 높았고(높은 선호도 비율).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.