[논문 리뷰] Can Everybody Sign Now? Exploring Sign Language Video Generation from 2D Poses
이 논문은 2D 자세 키포인트에서 생성된 현실적인 수어 영상이 원어로 수어를 구사하는 청각 장애인에게 이해 가능한지 여부를 조사한다. How2Sign 데이터셋의 일부에 대해 Everybody Dance Now (EDN) GAN 기반 운동 전이 모델을 사용하여, 생성된 영상은 뼈대 시각화보다 선호되지만 손의 생성 품질은 여전히 열악하여 전체 이해도 향상에도 불구하고 이해도 제한됨을 발견함.
Recent work have addressed the generation of human poses represented by 2D/3D coordinates of human joints for sign language. We use the state of the art in Deep Learning for motion transfer and evaluate them on How2Sign, an American Sign Language dataset, to generate videos of signers performing sign language given a 2D pose skeleton. We evaluate the generated videos quantitatively and qualitatively showing that the current models are not enough to generated adequate videos for Sign Language due to lack of detail in hands.
연구 동기 및 목표
- 2D 자세 키포인트에서 생성된 수어 영상가 원어로 수어를 구사하는 청각 장애인에게 이해 가능한지 평가하기.
- 2D 뼈대 시각화와 비교하여 현실적인 영상 출력의 이해도 평가하기.
- 최신 이미지 생성 모델(EDN)이 정확한 수어 영상을 생성하는 데서 보이는 한계 평가하기.
- 특히 수어에서 핵심적인 손의 경우, 생성 프레임에서의 키포인트 검출 신뢰도 정량화하기.
- 현재 신경망 생성 모델이 즉시 사용 가능한 효과적인 수어 번역을 지원할 수 있는지 조사하기.
제안 방법
- How2Sign 데이터셋의 소스 영상에서 2D 키포인트를 OpenPose를 사용해 추출함.
- 추출된 2D 자세 시퀀스에서 현실적인 서밍 영상을 생성하기 위해 Everybody Dance Now (EDN) GAN 기반 운동 전이 모델 적용함.
- 두 명의 전문 미국 수어 해설가를 포함하는 How2Sign 영상의 일부를 대상으로 EDN 모델을 훈련함. 한 명은 소스로, 다른 한 명은 타겟 신원으로 사용함.
- 시각적 품질 평가를 위해 두 가지 지표 사용: 검출 키포인트 비율(PDK) 및 정확한 키포인트 비율(PCK), OpenPose 신뢰도 기준으로 임계값 설정함.
- 네 명의 원어로 수어를 사용하는 청각 장애인을 대상으로 사용자 연구 수행. 뼈대 시각화와 생성된 영상 간 이해도 비교함.
- 주제 분류 정확도, 주관적 이해 가능성(MOS), 영어 번역 정확도(BLEU 점수)에 대한 피드백 수집함.
실험 결과
연구 질문
- RQ1최신 GAN 기반 방법을 사용해 2D 자세 키포인트에서 생성된 수어 영상가 원어로 수어를 구사하는 청각 장애인에게 이해 가능한가?
- RQ2생성된 현실적인 영상의 이해도는 2D 뼈대 시각화와 비교해 어떻게 되는가?
- RQ3현재 이미지 생성 모델이 수어의 핵심 구성 요소인 손 움직임을 얼마나 정확히 재현하는가?
- RQ4특히 손의 경우, 생성 프레임에서의 키포인트 검출은 얼마나 신뢰할 수 있는가?
- RQ5생성된 영상가 정확한 영어 번역을 지원할 수 있는가? 이는 세밀한 이해도를 나타냄.
주요 결과
- 생성된 영상은 뼈대 시각화보다 선호되었으며, 주제 분류 정확도는 91.6%로 뼈대 시각화의 83.3%보다 높음.
- 생성된 영상의 평균 의견 점수(MOS)는 2.58로 뼈대 시각화의 2.50보다 略로 높아, 더 나은 주관적 이해 가능성 나타냄.
- 영어 번역에 대한 BLEU 점수는 생성된 영상에서 더 높았음(BLEU-1: 12.38), 뼈대 시각화보다는 높지만, 모든 점수는 낮아 번역 정확도가 제한됨.
- 손 키포인트의 PCK는 높은 신뢰도 임계값에서 급격히 감소함 — 0.5 신뢰도 기준으로 정확도는 26%에 불과하여 손 생성 품질이 열악함을 시사함.
- 전체 상체 키포인트의 PDK는 높은 99%였지만, 손 키포인트의 검출 신뢰도는 낮음(PDK: 0.5 신뢰도 기준 17%), 이는 손 영역 합성에서 모델의 실패를 나타냄.
- 정성적 분석 결과, 생성된 영상에서 손 제스처와 문장 구조가 자주 잘못 렌더링되어 정확하거나 완전한 번역이 어려움.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.