Skip to main content
QUICK REVIEW

[논문 리뷰] G2P-DDM: Generating Sign Pose Sequence from Gloss Sequence with Discrete Diffusion Model

Pan Xie, Qipeng Zhang|arXiv (Cornell University)|2022. 08. 19.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

이 논문은 연속 자세 시퀀스를 다중 코드북 기반의 Pose-VQVAE를 통해 이산 토큰으로 변환한 후, 공간-시간적 의존성을 모델링하고 가변 길이 시퀀스 생성을 위해 히우리스틱 클러스터링 방법을 사용하는 이산 노이즈 제거 확산 모델(G2P-DDM)을 제안한다. 이는 RWTH-PHOENIX-WEATHER-2014T 벤치마크에서 77.26% WER를 기록하며 최신 기술을 초월하고, 인간 평가 결과에서도 뛰어난 성능을 보였다.

ABSTRACT

The Sign Language Production (SLP) project aims to automatically translate spoken languages into sign sequences. Our approach focuses on the transformation of sign gloss sequences into their corresponding sign pose sequences (G2P). In this paper, we present a novel solution for this task by converting the continuous pose space generation problem into a discrete sequence generation problem. We introduce the Pose-VQVAE framework, which combines Variational Autoencoders (VAEs) with vector quantization to produce a discrete latent representation for continuous pose sequences. Additionally, we propose the G2P-DDM model, a discrete denoising diffusion architecture for length-varied discrete sequence data, to model the latent prior. To further enhance the quality of pose sequence generation in the discrete space, we present the CodeUnet model to leverage spatial-temporal information. Lastly, we develop a heuristic sequential clustering method to predict variable lengths of pose sequences for corresponding gloss sequences. Our results show that our model outperforms state-of-the-art G2P models on the public SLP evaluation benchmark. For more generated results, please visit our project page: extcolor{blue}{\url{https://slpdiffusier.github.io/g2p-ddm}}

연구 동기 및 목표

  • 수어 생산(SLP)에서 말어진 글로스 시퀀스로부터 정확하고 가변 길이의 수어 자세 시퀀스를 생성하는 문제를 해결하기 위해.
  • 기존 G2P 모델에서 발생하는 오류 전파와 느린 순차적 디코딩 문제를 해결하기 위해 비순차적이고 반복적인 개선 방식을 도입하기 위해.
  • 특화된 VQ-VAE 아키텍처를 사용해 연속 자세 공간을 이산 잠재 공간으로 변환함으로써 자세 시퀀스 생성 품질을 향상시키기 위해.
  • 글로스와 자세 시퀀스 간의 복잡한 순차적 정렬을 가변 길이 시퀀스에 특화된 이산 노이즈 제거 확산 프레임워크를 통해 모델링하기 위해.
  • 가변 길이 생성 문제를 해결하기 위해 길이 예측을 위한 순차적 KNN 기반 클러스터링 방법을 제안하기 위해.

제안 방법

  • 자세 시퀀스를 세 개의 국소 패치(자세, 오른손, 왼손)로 나누고 각 패치에 별도의 코드북을 적용하여 연속 자세 시퀀스를 이산 토큰으로 변환하는 Pose-VQVAE를 도입함으로써 공간적 의미를 유지하고 재구성 품질을 향상시킴.
  • 이산 노이즈 제거 확산 모델(G2P-DDM)을 이산 잠재 코드에 적용하여 점진적으로 토큰을 마스킹하는 전방 부패 과정을 역행함으로써 반복적 개선이 가능한 시퀀스 생성을 가능하게 함.
  • 이산 시퀀스 전용으로 설계된 풀 트랜스포머 아키텍처인 CodeUnet을 사용하여 잠재 코드 시퀀스의 공간-시간적 의존성을 모델링함으로써 생성 품질 향상.
  • 자세 시퀀스의 경계를 탐지하기 위해 k-가까운 이웃 밀도 기반의 히우리스틱 순차 클러스터링 방법을 제안하여 가변 길이 글로스 시퀀스에 대한 정확한 길이 예측을 가능하게 함.
  • 추론 중에 글로스 시퀀스 길이를 추가 입력으로 사용하여 길이 예측을 보다 강화함으로써 정렬과 생성 정밀도 향상.
  • 전체 파이프라인은 이중 단계 학습 방식으로 구성됨: 먼저 Pose-VQVAE를 이산 코드 학습을 위해 사전 학습하고, 이후 CodeUnet을 사용해 조건부 생성을 위한 G2P-DDM을 미세 조정함.

실험 결과

연구 질문

  • RQ1글로스 시퀀스에 조건부로 가변 길이 수어 자세 시퀀스를 효과적으로 생성할 수 있는가? 이는 순차적 기반 모델보다 성능이 뛰어나게 하는가?
  • RQ2자세 표현을 손과 몸 등 국소 패치로 나누고 각각 별도의 코드북을 사용할 경우 재구성 및 생성 품질에 어떤 영향을 미치는가?
  • RQ3Pose-VQVAE와 동일한 이산 잠재 공간에서 표준 트랜스포머에 비해 전용 이산 시퀀스 모델인 CodeUnet이 공간-시간 모델링에 얼마나 더 효과적인가?
  • RQ4명시적 길이 지도 없이도 히우리스틱 클러스터링 기반 방법이 글로스 시퀀스에서 자세 시퀀스의 길이를 효과적으로 예측할 수 있는가?
  • RQ5이산 VQ-VAE와 확산 모델링의 조합이 비순차적 G2P 생성에서 생성 품질 향상과 오류 전파 감소에 얼마나 기여하는가?

주요 결과

  • 분리된 코드북(1024×3)을 사용한 Pose-VQVAE는 MSE가 0.0113로 가장 뛰어난 재구성 성능를 기록하였으며, 공유 코드북 및 통합 압축 변형보다 유의미하게 뛰어났다.
  • CodeUnet을 사용한 G2P-DDM 모델은 RWTH-PHOENIX-WEATHER-2014T 벤치마크에서 WER 77.26%를 기록하여 이전 최신 기술을 초월함.
  • 인간 평가 결과, 350명의 참가자 중 319명이 G2P-DDM의 생성 시퀀스를 베이스라인보다 선호하여 인지적 품질과 자연스러움이 뛰어남을 시사함.
  • 제거 실험을 통해 국소 자세 패치에 별도의 코드북을 사용함으로써 특징 혼동을 줄이고 재구성 성능를 향상시킴을 확인하였으며, T-SNE 시각화와 낮은 MSE로 이를 뒷받침함.
  • 추론 단계를 20에서 200으로 늘일수록 WER 성능 향상이 관찰되었고, 100단계 이후에는 포화 상태에 도달함을 확인하여 품질과 속도의 균형을 고려해 100단계를 선택함.
  • 동일한 확산 설정에서 표준 트랜스포머에 비해 CodeUnet 아키텍처가 더 빠르게 수렴하고 더 높은 성능을 달성함을 확인하여, 구조화된 이산 시퀀스 모델링에 효과적임을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.