[논문 리뷰] GANimation: Anatomically-aware Facial Animation from a Single Image
GANimation은 AU- 조건 GAN을 학습시켜 단일 얼굴 이미지를 연속적이고 해부학적으로 타당한 표정 매니폴드로 따라 애니메이션하며, 비지도 학습과 주의 집중을 통해 얼굴 부위에 초점을 맞춘다. 표현을 보간하고 야생 이미지도 처리할 수 있다.
Recent advances in Generative Adversarial Networks (GANs) have shown impressive results for task of facial expression synthesis. The most successful architecture is StarGAN, that conditions GANs generation process with images of a specific domain, namely a set of images of persons sharing the same expression. While effective, this approach can only generate a discrete number of expressions, determined by the content of the dataset. To address this limitation, in this paper, we introduce a novel GAN conditioning scheme based on Action Units (AU) annotations, which describes in a continuous manifold the anatomical facial movements defining a human expression. Our approach allows controlling the magnitude of activation of each AU and combine several of them. Additionally, we propose a fully unsupervised strategy to train the model, that only requires images annotated with their activated AUs, and exploit attention mechanisms that make our network robust to changing backgrounds and lighting conditions. Extensive evaluation show that our approach goes beyond competing conditional generators both in the capability to synthesize a much wider range of expressions ruled by anatomically feasible muscle movements, as in the capacity of dealing with images in the wild.
연구 동기 및 목표
- 이산적 감정 범주를 넘어 연속적이고 해부학적으로 타당한 얼굴 표정 합성을 고무한다.
- 행동 단위(AU)를 통한 표정 제어를 가능하게 하고 표정 간 보간을 수행한다.
- 다른 표정으로 촬영된 같은 사람의 쌍이 필요 없는 비지도 학습 프레임워크를 개발한다.
- 야생 이미지의 배경 및 조명 변화에 강건하게 대응하기 위한 주의 메커니즘을 포함한다.
제안 방법
- GAN을 연속적인 크기의 행동 단위 활성화 벡터에 조건화한다.
- A와 C라는 주의 마스크와 색상 변환 마스크를 출력하는 생성기를 사용하고, I_yf = (1−A)·C + A·I_yo 를 적용한다.
- 양방향 렌더링으로 학습한다: I_yo를 I_yf로 매핑하고 다시 I_yo로 되돌려 사이클 유사 일관성을 가능하게 한다.
- 조건 적합성을 위한 AU 활성화를 회귀하는 보조 헤드를 가진 WGAN-GP 비평가를 채택한다.
- 손실 항을 포함한다: 이미지 적대적 손실(WGAN-GP), 총변 변화를 통한 주의 부드러움, 조건부 AU 회귀 손실, 정체성(사이클) 손실.
- 비얼굴 콘텐츠를 보존하면서 얼굴 영역에 변화를 집중시키는 주의 가이드형 아키텍처를 구현한다.
실험 결과
연구 질문
- RQ1연속 AU 조건이 이산적 감정 범주보다 더 넓고 해부학적으로 그럴듯한 표정 범위를 가능하게 하는가?
- RQ2쌍으로 된 훈련 데이터 없이 단일 입력 이미지로도 현실적인 표정을 생성하는 비지도 AU-조건 GAN이 가능할까?
- RQ3주목 메커니즘을 도입하면 야생상에서의 리얼리즘과 배경/조명 강건성이 향상되는가?
- RQ4모델이 표현 간에 매끄럽게 보간하고 비정면 또는 야생 이미지에 편집을 적용할 수 있는가?
주요 결과
- 모델은 AU 크기를 변경하여 해부학적으로 일관된 얼굴 표정을 렌더링할 수 있으며, 부드러운 전환과 표현 간 보간을 포함한다.
- 주의 메커니즘은 얼굴 부위에 변화를 집중시키고 배경을 보존하여 야생 이미지에서도 고품질 결과를 가능하게 한다.
- DIAT, CycleGAN, IcGAN, StarGAN의 이산 감정 편집과 비교할 때, GANimation은 시각적 품질과 해상도가 더 높고 인공물도 적다.
- 이 방법은 얼굴 영역으로 자르고 주의 집중을 통해 원본 이미지와 매끄럽게 병합하여 배경 조명 변화와 잘려나지 않는 얼굴도 처리한다.
- 실험은 단 14개의 AU로도 다양한 표정을 생성할 수 있음을 보여 주며, 풍부한 표현력과 제어 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.