[논문 리뷰] Attention-Guided Generative Adversarial Networks for Unsupervised Image-to-Image Translation
이 논문은 쌍체 데이터나 외부 모델이 필요 없이 비지도 학습 이미지 간 번역을 위한 Attention-Guided Generative Adversarial Networks (AGGAN)를 제안한다. 새로이 도입된 생성자에는 구분 가능한 의미적 부분을 탐지하고 고해상도의 잡음 없는 이미지 번역을 위한 주의 맵/콘텐츠 맵을 생성하는 내장 주의 메커니즘이 탑재되어 있다. 이 방법은 쌍체 데이터 없이도 더 선명하고 현실적인 이미지를 생성하며 의미적 일致성과 세부 정보 유지 능력이 향상되어, 특히 얼굴 표정 전이에서 최신 기술 수준의 성능을 달성한다.
The state-of-the-art approaches in Generative Adversarial Networks (GANs) are able to learn a mapping function from one image domain to another with unpaired image data. However, these methods often produce artifacts and can only be able to convert low-level information, but fail to transfer high-level semantic part of images. The reason is mainly that generators do not have the ability to detect the most discriminative semantic part of images, which thus makes the generated images with low-quality. To handle the limitation, in this paper we propose a novel Attention-Guided Generative Adversarial Network (AGGAN), which can detect the most discriminative semantic object and minimize changes of unwanted part for semantic manipulation problems without using extra data and models. The attention-guided generators in AGGAN are able to produce attention masks via a built-in attention mechanism, and then fuse the input image with the attention mask to obtain a target image with high-quality. Moreover, we propose a novel attention-guided discriminator which only considers attended regions. The proposed AGGAN is trained by an end-to-end fashion with an adversarial loss, cycle-consistency loss, pixel loss and attention loss. Both qualitative and quantitative results demonstrate that our approach is effective to generate sharper and more accurate images than existing models. The code is available at https://github.com/Ha0Tang/AttentionGAN.
연구 동기 및 목표
- 기존의 GAN 기반 이미지 간 번역 모델이 고수준의 의미적 구조를 유지하지 못하고 번역 과정에서 잡음이 발생하는 데서 비롯되는 한계를 해결하기 위해.
- 쌍체 학습 데이터나 객체 마스크 예측을 위한 추가 모델이 필요 없이도 비지도 번역을 가능하게 하기 위해.
- 비구별적 의미적 부분(예: 눈, 입 등)을 자동으로 탐지하고 집중하면서도 관련 없는 배경 및 불필요한 영역을 유지할 수 있는 생성자를 개발하기 위해.
- 오직 주의된 영역만 평가하는 주의 지도 판별자를 도입하여 학습 안정성과 국소화 정확도를 향상시키기 위해.
- 이질성, 사이클 일致성, 픽셀 단위 손실, 주의 손실을 모두 포함한 엔드 투 엔드 학습을 통해 이미지 품질과 의미적 충실도를 향상시키기 위해.
제안 방법
- 제안된 AGGAN는 주의 모듈을 내장한 두 개의 생성자로 구성되며, 이는 구분 가능한 부분을 강조하는 주의 맵과 비구별적 영역을 유지하는 콘텐츠 맵을 동시에 출력한다.
- 생성자는 입력 이미지와 주의 맵, 콘텐츠 맵을 융합하여 비용이 적게 들고 고해상도의 번역된 이미지를 생성하며, 관련 없는 영역의 변화를 최소화한다.
- 새로운 주의 지도 판별자는 오직 주의된 영역만 평가하므로 국소화 정확도를 향상시키고 적응형 피드백의 노이즈를 줄인다.
- 이질성 손실, 사이클 일치 손실, 픽셀 단위 손실, 주의 손실의 조합을 사용해 엔드 투 엔드로 모델을 학습시켜 신뢰성과 일관성을 확보한다.
- 주의 메커니즘은 생성자 아키텍처에 직접 통합되어 외부 감독 없이도 주목할 만한 특징을 자율적으로 탐지할 수 있도록 한다.
- 기존 GAN 아키텍처와 호환되며, 다른 이미지 번역 작업에 쉽게 적용 가능하다.
실험 결과
연구 질문
- RQ1생성자 내장 주의 메커니즘이 비지도 이미지 간 번역 과정에서 구분 가능한 의미적 부분의 국소화에 기여하는가?
- RQ2오직 주의된 영역에 집중하는 주의 지도 판별자가 더 나은 이미지 품질과 더 적은 잡음을 유도하는가?
- RQ3제안된 AGGAN는 쌍체 데이터 없이도 더 선명하고 현실적인 이미지, 명확한 얼굴 세부 정보, 올바른 표정을 갖춘 이미지를 생성할 수 있는가?
- RQ4다양한 데이터셋에서 주의 맵 생성과 이미지 품질 및 의미적 일치도 간의 상관관계는 어떠한가?
- RQ5제안된 손실(주의, 픽셀, 사이클 일치성)이 전체 성능 향상에 얼마나 기여하는가?
주요 결과
- 제안된 AGGAN는 Pix2pix와 ContrastGAN와 같은 완전 지도 학습 모델을 포함한 최신 기술 수준의 모델들과 비교해 AR Face, Bu3dfe, CelebA 데이터셋에서 가장 뛰어난 정량적 성능을 달성한다.
- AR Face 데이터셋에서의 분석 결과, 주의 지도 생성자나 주의 손실을 제거할 경우 이미지 품질이 크게 악화됨을 확인하여 이 요소들이 핵심적인 역할을 한다는 것을 입증한다.
- 시각화 결과는 주의 맵이 항상 표정 전이에 가장 관련 깊은 눈, 입과 같은 핵심 얼굴 영역에 집중하고 있으며, 머리카락, 볼, 배경 등은 콘텐츠 맵으로 유지됨을 보여준다.
- 학습 과정에서 주의 맵이 발전하면서 이미지 품질과 점차 잘 맞춰지며, 구분 가능한 특징을 효과적으로 학습하고 있음을 시사한다.
- CycleGAN, DualGAN, DiscoGAN과 비교해 더 현실적인 얼굴 표정을 더 선명한 세부 정보와 더 적은 잡음으로 생성하는 데 뛰어난 성능을 발휘한다.
- 각 도메인에 대해 단일 생성자와 판별자만을 사용함에도 불구하고, 추가 객체 마스크 애너테이션에 의존하는 ContrastGAN와 같은 모델의 성능을 따라하거나 초월한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.