[논문 리뷰] Discriminative Region Proposal Adversarial Networks for High-Quality Image-to-Image Translation
이 논문은 고해상도 이미지 간 번역에서 고화질을 달성하기 위한 새로운 GAN 기반 프레임워크인 Discriminative Region Proposal Adversarial Networks (DRPAN)을 제안한다. 이 프레임워크는 판별적 영역 제안 네트워크와 전용 수정 모듈을 통해 반복적으로 가장 비현실적인 이미지 영역을 식별하고 개선한다. 가장 고장이 잘 나는 영역에 집중된 적대적 훈련을 통해 DRPAN은 Cityscapes, Zappos50k, 엣지-이미지 작업 등 다양한 벤치마크에서 최신 기술 수준의 비현실성과 세부 사항의 정확성 성능을 달성한다.
Image-to-image translation has been made much progress with embracing Generative Adversarial Networks (GANs). However, it's still very challenging for translation tasks that require high quality, especially at high-resolution and photorealism. In this paper, we present Discriminative Region Proposal Adversarial Networks (DRPAN) for high-quality image-to-image translation. We decompose the procedure of image-to-image translation task into three iterated steps, first is to generate an image with global structure but some local artifacts (via GAN), second is using our DRPnet to propose the most fake region from the generated image, and third is to implement "image inpainting" on the most fake region for more realistic result through a reviser, so that the system (DRPAN) can be gradually optimized to synthesize images with more attention on the most artifact local part. Experiments on a variety of image-to-image translation tasks and datasets validate that our method outperforms state-of-the-arts for producing high-quality translation results in terms of both human perceptual studies and automatic quantitative measures.
연구 동기 및 목표
- 고해상도에서 특히 문제가 되는 局부적 아티팩트와 흐릿한 세부 사항 문제를 해결한다.
- 표준 패치 기반 판별자들이 가장 문제적인 국부적 영역에서 생성자 개선을 이끌지 못하는 한계를 극복한다.
- 반복적으로 가장 가짜로 보이는 영역을 대상으로 하여 피드백 루프를 도입함으로써 비현실성과 구조적 정확성을 향상시킨다.
- 세분화된 세그먼테이션에서 사진으로, 스케치에서 이미지로, 엣지에서 이미지로의 다양한 이미지 번역 작업에 적용 가능한 일반화된 프레임워크를 개발한다.
- 자동 평가 지표와 인간의 시각적 평가를 향상시키기 위해 판별적 영역 제안과 전용 수정 네트워크를 결합한다.
제안 방법
- 이미지 번역을 세 단계의 반복적 과정으로 분해한다: (1) GAN이 전반적인 구조는 유지하면서 국부적 아티팩트가 있는 이미지를 생성하고, (2) DRPnet이 슬라이딩 윈도우를 사용한 패치 기반 판별 스코어를 통해 가장 가짜로 보이는 영역을 식별하며, (3) 수정 모듈이 국소적으로 이미지 복원을 수행하여 가장 비현실적인 영역을 개선한다.
- 패치 기반 판별자를 설계하여 가짜 확률이 높은 영역을 강조하는 판별 스코어 맵을 생성함으로써 아티팩트의 정확한 국소화를 가능하게 한다.
- 실제 이미지와 마스크된 가짜 영역(가장 가짜로 보이는 영역가 교체된 실제 이미지)을 구분하는 수정 네트워크를 도입하여 생성자에게 집중적인 피드백을 제공한다.
- 패치 판별자와 수정 모듈의 가중 손실을 조합하여 전역적이고 국소적 개선 간 균형을 이루며, 작업에 맞는 유연성을 확보한다.
- 생성자에 대한 전역 적대적 손실과 수정 모듈의 국소적 피드백을 기반으로 엔드 투 엔드로 GAN 훈련 루프를 적용한다.
- 가장 비현실적인 영역이 교체된 마스크된 실제 이미지(실제 이미지에서 가장 가짜로 보이는 영역을 가짜 영역으로 교체한 이미지)를 수정 모듈의 음성 샘플로 활용하여 문제 영역에 집중된 개선을 가능하게 한다.
실험 결과
연구 질문
- RQ1판별적 영역 제안 메커니즘이 GAN 기반 이미지 간 번역에서 아티팩트의 국소화를 향상시킬 수 있는가?
- RQ2가장 비현실적인 영역에 집중된 전용 수정 네트워크를 도입함으로써 표준 GAN보다 더 높은 시각적 품질을 달성할 수 있는가?
- RQ3가장 가짜로 보이는 영역에 대한 반복적 개선이 정량적 지표(예: IoU, 정확도)와 인간의 시각적 평가 점수를 크게 향상시킬 수 있는가?
- RQ4DRPAN은 세분화된 이미지에서 사진으로, 스케치에서 이미지로, 엣지에서 이미지로의 다양한 이미지 번역 작업에서 어떻게 성능을 발휘하는가?
- RQ5최신 기술 모델인 Pix2pix와 CRN에 비해 더 높은 비현실성과 낮은 블러를 유지하면서도 고해상도 출력을 달성할 수 있는가?
주요 결과
- Cityscapes 데이터셋에서 DRPAN은 88%의 픽셀별 정확도, 52%의 클래스별 정확도, 43%의 클래스 IOU를 기록하여 Pix2pix(83%, 36%, 29%)와 L1+U-Net(86%, 42%, 35%)를 초월하는 정량적 성능을 달성했다.
- 인간의 시각적 평가 연구에서, 18.2%의 참가자가 DRPAN이 생성한 이미지를 실제 이미지로 판단했으며, 이는 Pix2pix(5.3%), StackGAN 유사 모델(6.8%), CRN(9.4%)보다 유의미하게 높은 성능이다.
- 지도에서 항공사진으로의 작업에서, DRPAN은 33.4%의 터커가 생성된 이미지를 실제 이미지로 오인했고, 이는 Pix2pix(25.2%)와 CycleGAN(26.8%)보다 높은 성능을 보였다.
- 엣지-이미지 및 스케치-이미지 작업에서, DRPAN은 특히 희박하거나 모호한 입력에서 Pix2pix보다 더 선명하고 현실적인 결과를 생성했으며 아티팩트가 적었다.
- 제거 실험 결과, 가짜 마스크 메커니즘을 제거하면 성능이 떨어져 수정 모듈이 국소적 아티팩트를 개선하는 데 중요한 역할을 함을 확인했다.
- 쌍대 비교에서 인간 평가 기반 비현실성 평가에서 DRPAN은 가장 높은 점수를 기록했다: 세분화된 이미지에서 사진으로의 작업에서 91.2%의 참가자가 DRPAN을 Pix2pix보다 선호했고, 84.6%가 StackGAN 유사 모델보다, 75.7%가 CRN보다 선호했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.