[논문 리뷰] Every Smile is Unique: Landmark-Guided Diverse Smile Generation
이 논문은 얼굴 랜드마크를 동적 표현으로 활용하여 단일한 중립 얼굴 이미지에서 다양한 실사성 있는 미소 영상을 생성하는 조건부 다중모드 네트워크인 CMM-Net을 제안한다. 얼굴 랜드마크를 임bedding하기 위해 변동형 오토인코더(Variational Auto-Encoder)를 사용하고, 표현 유형에 맞는 임베딩을 생성하기 위해 조건부 LSTM을 활용하며, 다중모드 순환 생성기로 서로 다른 랜드마크 시퀀스를 생성하여 고해상도 영상으로 변환한다. 이는 실사성과 액션 유닛 역학에서 기존의 베이스라인을 능가한다.
Each smile is unique: one person surely smiles in different ways (e.g., closing/opening the eyes or mouth). Given one input image of a neutral face, can we generate multiple smile videos with distinctive characteristics? To tackle this one-to-many video generation problem, we propose a novel deep learning architecture named Conditional Multi-Mode Network (CMM-Net). To better encode the dynamics of facial expressions, CMM-Net explicitly exploits facial landmarks for generating smile sequences. Specifically, a variational auto-encoder is used to learn a facial landmark embedding. This single embedding is then exploited by a conditional recurrent network which generates a landmark embedding sequence conditioned on a specific expression (e.g., spontaneous smile). Next, the generated landmark embeddings are fed into a multi-mode recurrent landmark generator, producing a set of landmark sequences still associated to the given smile class but clearly distinct from each other. Finally, these landmark sequences are translated into face videos. Our experimental results demonstrate the effectiveness of our CMM-Net in generating realistic videos of multiple smile expressions.
연구 동기 및 목표
- 단일 중립 얼굴 이미지에서 여러 개의 다른 미소 영상을 생성하는 문제를 해결하기 위해, 특히 동일한 얼굴 이미지에서 다양한 미소 영상을 생성하는 데 초점한다.
- 같은 표현 유형(예: 자연스러운 미소 대비 포즈한 미소) 내에서 눈과 입의 움직임 차이 등 얼굴 표정의 동적 변동을 모델링한다.
- 얼굴 랜드마크를 통해 표현 역학을 명시적으로 인코딩하여 얼굴 표정 생성의 강건성과 실사성을 향상시킨다.
- 동일한 정체성을 유지하면서도 서로 다른 시간 역학을 가진 고유한 고품질의 미소 시퀀스를 생성할 수 있는 프레임워크를 개발한다.
- 가상 애니메이션, 얼굴 인식, 합성 데이터 생성 등 다양한 응용 분야를 위해 다양한 실사성 있는 표현 시퀀스를 생성할 수 있도록 한다.
제안 방법
- 학습 데이터에서 얼굴 랜드마크 시퀀스의 압축되고 분리된 임베딩을 학습하기 위해 변동형 오토인코더(Variational Auto-Encoder, VAE)를 사용한다.
- 입력 중립 얼굴 랜드마크와 특정 표현 레이블(예: 자연스러운 또는 포즈한 미소)을 조건으로 하여, 조건부 순환 네트워크(LSTM)가 랜드마크 임베딩의 시퀀스를 생성한다.
- 다중모드 순환 생성기로, 동일한 표현 유형에 대해 서로 다른 랜드마크 임베딩 시퀀스를 생성하기 위해 병렬로 구성된 다수의 LSTM을 활용한다.
- 생성된 랜드마크 시퀀스는 U-Net 유사 이미지 번역 네트워크에 입력되어 정체성과 얼굴 세부 정보를 유지하면서도 실사성 있는 얼굴 영상을 합성한다.
- 실사성과 정확도를 확보하기 위해 적대적 손실, 인지적 손실, 재구성 손실을 포함한 엔드 투 엔드 학습 방식을 적용한다.
- 다중모드 생성기에는 추가적인 진짜 레이블이 필요로 하지 않으며, 잠재 공간의 확률적 성격과 다중헤드 생성을 통해 다양성을 학습한다.
실험 결과
연구 질문
- RQ1입력이 동일한 단일 중립 얼굴 이미지에서 조건부로 여러 개의 서로 다른 실사성 있는 미소 영상을 생성할 수 있는가?
- RQ2동일한 표현 클래스 내에서(예: 눈과 입의 움직임이 다른 자연스러운 미소) 랜드마크를 효과적으로 활용하여 얼굴 표정의 동적 변동을 모델링할 수 있는가?
- RQ3제안된 랜드마크 유도 다중모드 생성 방식이 기존의 영상 생성 모델 대비 실사성과 다양성에서 얼마나 향상되었는가?
- RQ4생성된 얼굴 표정 역학(예: 액션 유닛 강도)이 실제 인간의 표정과 유사한가?
- RQ5조건부 및 다중모드 순환 네트워크의 사용이 생성된 영상에서 정체성과 시각적 품질의 유지에 얼마나 기여하는가?
주요 결과
- CMM-Net은 실재 시퀀스와 비교해 최고의 SSIM 점수(0.898)를 기록했으며, IS 점수 차이(ΔIS = 0.12)가 가장 작아 이미지 품질과 실사성에서 뛰어난 성능을 보였다.
- 사용자 연구 결과, 68.2%의 평가자가 CMM-Net이 생성한 영상을 Video GAN 대비 선호했고, 65.5%는 CRA-Net 대비 선호하여 더 높은 실사성 인식을 확인했다.
- CMM-Net 생성 시퀀스에서 볼두스 상승 액션 유닛(AU)의 역학은 원본 데이터와 매우 유사하며, 거리 측정 기준으로 UvA-NEMO 자연스러운 경우 2.234, 포즈한 경우 1.472로, Video GAN(2.976 및 2.618)보다 유의미하게 낮았다.
- 다중모드 생성기는 빌드된 랜드마크 시퀀스가 서로 뚜렷하게 다름을 시각적 점검과 정량적 AU 역학 분석을 통해 확인했다.
- SSIM, IS, AU 곡선 유사도 등 모든 평가 지표에서 CMM-Net은 Video GAN 및 CRA-Net을 모두 압도하며, 다양한 고품질 영상을 생성하는 데서의 효과성을 입증했다.
- 생성된 시퀀스 간 정체성 일관성이 유지되었으며, 다양한 표현 역학에도 불구하고 합성 영상에서 안면 구조와 외형이 안정적으로 유지됨을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.