[논문 리뷰] SignDiff: Diffusion Model for American Sign Language Production
이 논문은 텍스트에서 비디오로의 엔드 투 엔드 아메리칸 술어어법(ASL) 생성을 위한 확산 기반 모델인 SignDiff를 소개한다. 이는 자세 정확도를 향상시키고 손가락 잡음 요소를 줄이기 위해 새로운 프레임 강화 네트워크(FR-Net)를 활용한다. How2Sign에서 BLEU-4 17.19점, SSIM 84.9%를 기록하며, 이미지 품질과 제스처 충실도 측면에서 이전 방법들을 크게 능가하는 최신 기술 성과를 달성한다.
In this paper, we propose a dual-condition diffusion pre-training model named SignDiff that can generate human sign language speakers from a skeleton pose. SignDiff has a novel Frame Reinforcement Network called FR-Net, similar to dense human pose estimation work, which enhances the correspondence between text lexical symbols and sign language dense pose frames, reduces the occurrence of multiple fingers in the diffusion model. In addition, we propose a new method for American Sign Language Production (ASLP), which can generate ASL skeletal pose videos from text input, integrating two new improved modules and a new loss function to improve the accuracy and quality of sign language skeletal posture and enhance the ability of the model to train on large-scale data. We propose the first baseline for ASL production and report the scores of 17.19 and 12.85 on BLEU-4 on the How2Sign dev/test sets. We evaluated our model on the previous mainstream dataset PHOENIX14T, and the experiments achieved the SOTA results. In addition, our image quality far exceeds all previous results by 10 percentage points in terms of SSIM.
연구 동기 및 목표
- 지속적인 아메리칸 술어어법 생산(ASLP)을 위한 대규모 사전 학습된 딥 러닝 모델의 부족을 해결하기 위해.
- 이전에 복잡성으로 인해 활용이 부족했던 How2Sign 데이터셋을 기반으로, 확산 모델을 활용한 엔드 투 엔드 텍스트-서브비디오 생성을 가능하게 하기 위해.
- 다중 손가락과 같은 잡음 요소를 줄이고 뼈대 자세 정확도를 향상시켜 술어어법 생성 품질을 향상시키기 위해.
- 대규모 고품질 데이터와 확산 기반 아키텍처를 활용해 ASL 생산을 위한 첫 번째 종합적 기준선을 수립하기 위해.
- 새로운 모듈과 맞춤형 손실 함수를 통해 훈련 효율성과 모델 안정성을 향상시키기 위해.
제안 방법
- 텍스트와 자세 임베딩을 모두 조건으로 삼는 이중 조건 확산 모델인 SignDiff를 제안하여 3D 인간 술어어법 비디오를 생성한다.
- 어휘 기호와 조밀한 자세 프레임 간의 대응을 강화하기 위해 밀도 높은 인간 자세 추정에 영감을 받은 새로운 구성요소인 프레임 강화 네트워크(FR-Net)를 도입한다.
- 뼈대 자세 정확도 향상과 손가락 잡음 감소를 위해 감각적, 关键점, 적대적 손실을 조합한 새로운 손실 함수를 활용한다.
- 예측된 뼈대 시퀀스에서 현실적인 술어어법 비디오를 생성하기 위해 자세 조건 기반의 인간 합성 헤드를 사용한다.
- 대규모 훈련을 지원하기 위해 How2Sign 데이터셋을 광범위한 전처리 및 데이터 증강 처리를 통해 변환한다.
- 국소적 손 세부 정보 향상과 전반적 운동 일관성 향상을 위해 손 자세 향상 모듈과 다중 척도 특징 정련을 통합한다.
실험 결과
연구 질문
- RQ1확산 기반 모델이 자세 정확도 향상과 잡음 감소를 통해 고해상도 연속적 ASL 비디오 생성을 텍스트 입력으로부터 달성할 수 있는가?
- RQ2제안된 프레임 강화 네트워크(FR-Net)는 술어어법 생성에서 텍스트와 조밀한 자세 프레임 간의 대응을 어떻게 향상시키는가?
- RQ3새로운 손실 함수와 보조 모듈은 술어어법 비디오 생성의 품질과 안정성에 어떤 영향을 미치는가?
- RQ4SignDiff는 How2Sign 및 PHOENIX14T에서 BLEU, SSIM, FID, DTW 지표 측면에서 기존 최신 기술 모델과 비교해 어떻게 성능을 냈는가?
- RQ5FR-Net는 성능 저하 없이 훈련 효율성과 수렴 속도를 얼마나 향상시키는가?
주요 결과
- SignDiff는 How2Sign 개발 세트에서 BLEU-4 점수 17.19점, 테스트 세트에서 12.85점을 기록하여 ASL 생산을 위한 첫 번째 강력한 기준선을 수립한다.
- 이 모델은 SSIM 84.9%, 손의 SSIM 67.6%를 기록하며, 이는 이전 방법들보다 이미지 품질 측면에서 10%p 이상 뛰어난 성능이다.
- FR-Net를 적용한 결과 손 자세 오차가 23.09의 베이스라인 대비 20.04로 크게 향상되었다.
- 제거 실험 결과 FR-Net가 이미지 품질과 DTW 성능을 모두 향상시켜 참값 시퀀스와의 정렬도 향상됨을 확인하였다.
- 정성적 결과에서는 Stable Diffusion(정확하지만 흐릿함)이나 만화 스타일 모델(세부 정보는 있지만 정확도 떨어짐)보다 SignDiff가 제스처 정확도와 손가락 세부 정보의 균형을 더 잘 유지하고 있음을 보여주었다.
- 모델은 How2Sign에서 훈련되었음에도 불구하고 PHOENIX14T에서 최신 기술 성과를 달성하여 다양한 데이터셋에 대한 강력한 일반화 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.