[논문 리뷰] Multi-Mapping Image-to-Image Translation with Central Biasing Normalization
이 논문은 다중 매핑 이미지 간 번역 모델에서 잠재 코드 주입을 안정화시키는 새로운 정규화 기법인 중심 편향 정규화(Central Biasing Normalization, CBN)를 제안한다. 기존 배치 정규화나 인스턴스 정규화로 인한 모드 붕괴 문제를 해결하며, StarGAN, BicycleGAN, pix2pix 등의 모델에서 다양성과 이미지 품질을 향상시킨다. 수렴 속도가 빨라지고 네트워크 아키텍처 선택에 대한 민감도가 감소한다.
Recent advances in image-to-image translation have seen a rise in approaches generating diverse images through a single network. To indicate the target domain for a one-to-many mapping, the latent code is injected into the generator network. However, we found that the injection method leads to mode collapse because of normalization strategies. Existing normalization strategies might either cause the inconsistency of feature distribution or eliminate the effect of the latent code. To solve these problems, we propose the consistency within diversity criteria for designing the multi-mapping model. Based on the criteria, we propose central biasing normalization to inject the latent code information. Experiments show that our method can improve the quality and diversity of existing image-to-image translation models, such as StarGAN, BicycleGAN, and pix2pix.
연구 동기 및 목표
- 표준 정규화 레이어로 인해 발생하는 기능 분포의 일관성 부족으로 인한 다중 매핑 이미지 간 번역에서의 모드 붕괴 문제를 해결하기 위해.
- 잠재 코드 주입의 불안정성의 근본 원인을 규명하며, 특히 배치 또는 인스턴스 정규화가 잠재 코드 영향력에 간섭하는 방식을 분석하기 위해.
- 강력한 다중 매핑 모델을 설계하기 위한 다양성 기준의 일관성 원칙을 설정하기 위해.
- 잠재 코드 정보를 정규화 통계에 직접 주입함으로써 안정적이고 분리된, 다양한 생성을 보장하는 정규화 방법인 중심 편향 정규화(CBN)를 개발하기 위해.
제안 방법
- 합성곱 출력을 잠재 코드에 의해 영향을 받는 평균 성분과 잔차 성분으로 분해함으로써, 잠재 코드가 기능 맵 평균에 오프셋 역할을 한다는 것을 보여준다.
- 중앙 편향 정규화(CBN)는 표준 정규화 레이어를 대체하여, 잠재 코드에서 학습 가능한 편향 벡터를 학습함으로써 배치 정규화 통계를 이동시켜, 각 타겟 매핑에 대해 일관된 기능 분포를 보장한다.
- CBN는 배치 정규화 레이어의 누적 평균과 분산을 스케일링 및 이동시키는 데 잠재 코드를 적용함으로써 생성자 네트워크에 통합되며, 출력 분포에 명시적인 제어를 가능하게 한다.
- 이 방법은 아키텍처에 종속되지 않으며, 잠재 코드 임bedding 외에 추가 파라미터가 필요하지 않아 기존 모델에 쉽게 통합할 수 있다.
- CBN는 StarGAN, BicycleGAN, pix2pix에서의 추론 실험을 통해 표준 잠재 코드 주입 방식과 배치/인스턴스 정규화를 비교하여 검증되었다.
- CBN는 내부 공변량 이동을 감소시키고 학습 안정성을 향상시켜 더 빠른 수렴과 더 낮은 재구성 손실을 이끌어낸다.
실험 결과
연구 질문
- RQ1다중 매핑 이미지 간 번역 과정에서 잠재 코드가 합성곱 레이어의 기능 맵 평균에 어떻게 영향을 미치는가?
- RQ2왜 표준 정규화 레이어인 배치 정규화나 인스턴스 정규화가 잠재 코드 기반 모델에서 모드 붕괴와 일관성 없는 출력을 유발하는가?
- RQ3잠재 코드가 기능 분포를 방해하지 않으면서도 다양한 출력 매핑을 효과적으로 제어하기 위해 필요한 설계 원칙은 무엇인가?
- RQ4다양한 네트워크 아키텍처와 하이퍼파rameter에 걸쳐 잠재 코드 주입을 안정화할 수 있는 정규화 전략을 설계할 수 있는가?
주요 결과
- CBN는 레이블2포토 및 얼굴 속성 전이 작업에서 생성 이미지의 다양성을 크게 향상시키며, 표준 잠재 코드 주입 대비 인지적 거리 점수를 최대 15% 향상시킨다.
- BicycleGAN의 수렴 속도가 CBN로 가속화되어 손실 곡선 비교 결과에서 조기 단계에서 더 낮은 재구성 손실을 달성한다.
- pix2pix에 랜덤 가우시안 노이즈를 잠재 코드로 주입한 경우에도, CBN에 드롭아웃과 함께 잠재 코드 차원을 증가시킴으로써 다양성이 향상되어 기존 방법을 능가한다.
- CBN는 팯딩 전략, 정규화 유형, 잠재 코드 차원과 같은 아키텍처 선택에 대해 강건하며, 하이퍼파rameter 튜닝에 대한 민감도를 감소시킨다.
- CBN는 생성자에서 내부 공변량 이동을 감소시켜 더 안정적인 학습 역학과 다양한 데이터셋에 걸친 개선된 일반화 성능을 이끌어낸다.
- qualitative 및 quantitative 평가에서 CBN는 BicycleGAN 및 StarGAN과 같은 베이스라인 모델보다 더 뛰어난 성능을 보이며, 특히 미세한 스타일 및 속성 변화를 잘 포착한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.