[논문 리뷰] Biphasic Learning of GANs for High-Resolution Image-to-Image Translation
이 논문은 고해상도 이미지 간 번역에 대해 훈련 안정성과 품질을 햖스르기 위해 훈련을 초기 저해상도 적대적 단계와 지식 정착 및 지각 일致성 정규화를 통한 고해상도 향상 단계로 분리하는 새로운 GAN 훈련 프레임워크인 이단계 훈련을 제안한다. 이 방법은 1024² 해상도에서 최신 기술 수준의 성능을 달성하며, 이전 방법들에 비해 시각적 품질과 훈련 안정성 측면에서 뚜렷한 우월성을 보인다.
Despite that the performance of image-to-image translation has been significantly improved by recent progress in generative models, current methods still suffer from severe degradation in training stability and sample quality when applied to the high-resolution situation. In this work, we present a novel training framework for GANs, namely biphasic learning, to achieve image-to-image translation in multiple visual domains at $1024^2$ resolution. Our core idea is to design an adjustable objective function that varies across training phases. Within the biphasic learning framework, we propose a novel inherited adversarial loss to achieve the enhancement of model capacity and stabilize the training phase transition. Furthermore, we introduce a perceptual-level consistency loss through mutual information estimation and maximization. To verify the superiority of the proposed method, we apply it to a wide range of face-related synthesis tasks and conduct experiments on multiple large-scale datasets. Through comprehensive quantitative analyses, we demonstrate that our method significantly outperforms existing methods.
연구 동기 및 목표
- 고해상도 이미지 간 번역에 GAN를 적용할 경우 발생하는 심각한 훈련 안정성 및 샘플 품질 열화 문제를 해결하기 위해.
- 1024² 해상도에서 안정적이고 효과적인 적대적 훈련을 가능하게 하는 훈련 프레임워크를 개발하기 위해.
- 쌍화된 훈련 데이터에 의존하지 않고도 시각적 현실감과 의미 일致성을 향상시키기 위해.
- 지식 정착과 지각 수준의 감독을 통해 모델의 능력과 일반화 능력을 향상시키기 위해.
제안 방법
- 프레임워크는 훈련을 두 단계로 나눈다: 초기 저해상도 적대적 훈련 단계와 그 다음 고해상도 향상 단계.
- 초기 판별기에서 유도된 적대적 손실을 도입하여 지식 정착을 통해 초기 판별기의 지식을 향상된 생성기와 판별기로 전달한다.
- 초기 단계에서 훈련된 보조 판별기는 고정된 채로 유지되며, 향상 단계에서 감독 헤드로 재사용된다.
- 사전 훈련된 신경 추정기를 사용하여 소스 이미지와 번역된 이미지 간의 지각 유사도를 최대화하기 위해 상호 지각 정보 정규화를 설계한다.
- 손실 함수는 단계 간에 적응적으로 업데이트되며, 향상 단계에서는 픽셀 수준의 손실이 지각 수준의 감독으로 대체된다.
- 이 방법은 쌍화된 데이터에 의존하지 않는 비지도 설정에서 작동하며, 신원과 속성 일치성을 유지한다.
실험 결과
연구 질문
- RQ1두 단계 훈련 전략은 1024² 해상도에서 GAN 훈련의 안정성과 샘플 품질을 향상시킬 수 있는가?
- RQ2저해상도 판별기에서 유도된 지식을 효과적으로 고해상도 생성에 전달할 수 있는가?
- RQ3쌍화된 데이터 없이도 특징 간 상호 정보 추정이 지각 일치성을 향상시키는 데 기여하는가?
- RQ4지식 정착과 지각 정규화를 조합하면 기존 GAN 손실에 비해 더 뛰어난 시각적 현실감을 달성할 수 있는가?
- RQ5이 프레임워크는 전면화 및 속성 전이를 포함한 다양한 얼굴 관련 번역 작업에 일반화될 수 있는가?
주요 결과
- BiL-GAN은 Multi-PIE 데이터셋에서 ±15° 자세 변화 조건에서 순위 1 얼굴 인식 정확도 99.96%를 기록하여 이전 모든 방법을 초월한다.
- 동일한 데이터셋에서 ±60° 조건에서도 99.90%의 정확도를 달성하며, 이는 이전 최고 성능 방법(HF-PIM)의 99.1%보다 뚜렷한 향상이다.
- RaFD에서의 얼굴 애니메이션 작업에서 BiL-GAN은 ±15° 조건에서 99.96%의 인식 정확도를 기록하여 이전 최고 성능 방법(HF-PIM)의 99.9%를 뛰어넘었다.
- 절단 실험 결과, 상호 지각 정보 손실을 제거할 경우 성능에 뚜렷한 하락이 발생함을 확인하여, 이 손실이 핵심적인 역할을 한다는 것을 입증했다.
- 이 방법은 CycleGAN 및 기타 최신 기술 수준의 방법들에 비해 더 뛰어난 질감 세부 정보와 신원 유지 능력을 보이며, 1024² 해상도에서 매우 현실적이고 고해상도의 결과를 생성한다.
- 고해상도 조건에서도 단계 전환 시 안정성을 유지하고 모드 붕괴를 방지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.