[논문 리뷰] UGAN: Untraceable GAN for Multi-Domain Face Translation
UGAN은 원본 특성 잔류 문제를 해결하기 위해 비추적성 GAN 프레임워크를 제안한다. 이는 잔류한 원본 특징을 탐지하기 위한 소스 분류기와 타겟 전용 특징을 강제로 구현하기 위한 타겟 프로토타입 주입 기법을 도입한다. 이 방법은 얼굴 노화, 메이크업 편집, 표정 편집에서 SOTA 모델인 StarGAN을 뛰어넘으며, 더 낮은 FID 점수와 더 높은 사용자 선호도를 기록하여 뛰어난 현실성과 도메인 특화된 충실도를 달성한다.
The multi-domain image-to-image translation is a challenging task where the goal is to translate an image into multiple different domains. The target-only characteristics are desired for translated images, while the source-only characteristics should be erased. However, recent methods often suffer from retaining the characteristics of the source domain, which are incompatible with the target domain. To address this issue, we propose a method called Untraceable GAN, which has a novel source classifier to differentiate which domain an image is translated from, and determines whether the translated image still retains the characteristics of the source domain. Furthermore, we take the prototype of the target domain as the guidance for the translator to effectively synthesize the target-only characteristics. The translator is learned to synthesize the target-only characteristics and make the source domain untraceable for the discriminator, so that the source-only characteristics are erased. Finally, extensive experiments on three face editing tasks, including face aging, makeup, and expression editing, show that the proposed UGAN can produce superior results over the state-of-the-art models. The source code will be released.
연구 동기 및 목표
- 다중 도메인 이미지 간 번역에서 원본 도메인의 불일치하는 특징이 그대로 유지되는 현상인 소스 유지 현상을 규명하고 해결하는 것.
- 예를 들어 콧수염, 주름과 같은 원본 전용 특징을 명시적으로 제거하면서도, 부드러운 피부, 큰 눈과 같은 진정성 있는 타겟 전용 특징을 합성할 수 있는 메커니즘 개발.
- 번역된 이미지가 여전히 원본 도메인의 흔적을 남기고 있는지 탐지하기 위해 디스criminator 내부에 소스 분류기를 도입하여 타겟 최적화를 가능하게 하는 것.
- 얼굴 구조나 질감과 같은 타겟 도메인 특징을 충실하게 합성하기 위해 도메인 프로토타입을 활용해 번역기를 안내하는 것.
- 얼굴 노화, 메이크업 편집, 표정 편집이라는 세 가지 얼굴 편집 작업 전반에서 UGAN의 효과성을 입증하는 것.
제안 방법
- 생성기에서 원본 도메인의 특징을 판단하기 위해 디스criminator 내부에 소스 분류기를 학습시켜, 생성된 이미지의 잔류한 원본 특징을 탐지할 수 있도록 한다.
- 생성기는 소스 분류기를 속이도록 최적화되어 원본 도메인을 추적할 수 없게 되며, 이는 원본 전용 특징의 완전한 제거를 장려한다.
- 주요 특징(예: 어린이의 둥근 얼굴)을 통계적으로 표현한 타겟 도메인 프로토타입을 추출하고, 이를 생성기의 합성에 주입하여 타겟 전용 특징의 합성을 안내한다.
- 생성기는 적대적 손실, 사이클 일致성, 프로토타입 기반 복원 손실을 조합한 다중 손실 목표함수를 통해 최적화되어, 충실도와 도메인 특화도를 보장한다.
- 이중 디스criminator 아키텍처를 사용하여, 하나는 도메인 분류를, 다른 하나는 원본 도메인 추적을 담당함으로써 분리된 최적화를 가능하게 한다.
- 프로토타입 주입은 생성기의 스킵 커넥션에서 특징 수준의 변조 방식으로 구현되어, 생성된 특징이 타겟 도메인 통계와 일치하도록 한다.
실험 결과
연구 질문
- RQ1원본 도메인 분류기가 실패할 경우에도 소스 분류기가 번역된 이미지의 잔류한 원본 특징을 효과적으로 탐지할 수 있는가?
- RQ2원본 도메인을 은폐하는 비추적성 훈련 방식이 다중 도메인 얼굴 번역에서 원본 유지 현상을 어느 정도 줄일 수 있는가?
- RQ3프로토타입 주입이 얼굴 구조나 질감과 같은 진정성 있는 타겟 도메인 특징의 합성에 어떤 영향을 미치는가?
- RQ4제안된 UGAN 프레임워크가 얼굴 편집 작업 전반에서 수치적 지표와 인간 평가 모두에서 StarGAN과 같은 SOTA 모델을 능가하는가?
- RQ5UGAN 프레임워크는 얼굴 편집 외에도 언어나 스타일 전이와 같은 다른 이미지 번역 작업에 일반화 가능한가?
주요 결과
- CelebA-HQ 얼굴 노화 데이터셋에서 UGAN은 평균 내부 FID 점수 28.4를 기록하여 StarGAN의 44.8보다 유의미하게 낮게, 더 뛰어난 이미지 품질과 도메인 일관성을 보여주었다.
- 아마존 Mechanical Turk에서의 사용자 연구 결과, UGAN은 0–10세 연령대로의 얼굴 번역에서 86.8%의 경우에서 StarGAN을 앞서는 것으로 나타나, 더 현실적인 어린이 외형에 대한 강한 선호도를 보였다.
- 모든 연령대 간격에서 소스와 번역된 이미지의 특징 간 코사인 유사도 평균이 UGAN에서 일관되게 낮게 유지되어, 원본 특징의 더 효과적인 제거가 이루어졌음을 확인했다.
- 정성적 결과에서는 UGAN이 어린이 번역에서 콧수염과 주름을 성공적으로 제거했으며, 자연스러운 메이크업과 표정 변화를 생성한 반면, StarGAN은 원래 특징을 유지하는 것으로 나타났다.
- MAKEUP-A5 데이터셋에서 UGAN은 비대칭성과 비자연스러운 질감이 나타나는 StarGAN 출력에 비해 더 자연스러운 블러셔와 아이섀도우 분포를 생성했다.
- 표정 편집 작업에서는 UGAN이 복합 표현과 기본 표현 간 미세한 차이(예: '기쁨과 놀라움' 대비 '기쁨')를 정확히 포착한 반면, StarGAN은 원래의 표정(예: 쫙 맞춘 눈썹)을 유지하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.