Skip to main content
QUICK REVIEW

[논문 리뷰] Attentive Normalization for Conditional Image Generation

Yi Wang, Ying-Cong Chen|arXiv (Cornell University)|2020. 04. 08.
Generative Adversarial Networks and Image Synthesis참고 문헌 57인용 수 5
한 줄 요약

이 논문은 조건부 이미지 생성에서 장거리 의존성 모델링을 향상시키기 위해 특징 맵에서 의미적 레이아웃을 학습하고 의미적으로 일관된 영역 내에서 인스턴스 정규화를 적용하는 새로운 정규화 모듈인 Attentive Normalization (AN)을 제안한다. AN은 ImageNet (128×128) 클래스 조건부 생성에서 상태의 기준(FID 17.84)을 달성하며, 계산 비용이 훨씬 낮은 자기주의 GAN(18.65)을 능가한다.

ABSTRACT

Traditional convolution-based generative adversarial networks synthesize images based on hierarchical local operations, where long-range dependency relation is implicitly modeled with a Markov chain. It is still not sufficient for categories with complicated structures. In this paper, we characterize long-range dependence with attentive normalization (AN), which is an extension to traditional instance normalization. Specifically, the input feature map is softly divided into several regions based on its internal semantic similarity, which are respectively normalized. It enhances consistency between distant regions with semantic correspondence. Compared with self-attention GAN, our attentive normalization does not need to measure the correlation of all locations, and thus can be directly applied to large-size feature maps without much computational burden. Extensive experiments on class-conditional image generation and semantic inpainting verify the efficacy of our proposed module.

연구 동기 및 목표

  • 복잡한 구조적 이미지에서 컨볼루션 네트워크가 장거리 공간적 의존성을 모델링하는 데 한계가 있음을 해결한다.
  • 이미지 생성 중 큰 특징 맵에서 자기주의 기반 메커니즘의 높은 계산 비용을 완화한다.
  • 멀리 떨어진 영역 간의 의미적 대응을 명시적으로 모델링하여 생성된 이미지의 의미 일관성과 구조적 일관성을 향상시킨다.
  • 표준 인스턴스 정규화에서 발생하는 공간적 열화를 줄이고 고수준 의미를 유지 및 강화하는 정규화 기법을 개발한다.
  • 대규모 이미지 생성 및 인painting 작업에 적합한 효율적이고 확장 가능한 장거리 모델링을 가능하게 한다.

제안 방법

  • 의미적 엔티티 클러스터링 기반의 학습 가능한 모듈을 사용해 입력 특징 맵으로부터 의미적 레이아웃을 예측하는 Attentive Normalization (AN)을 제안한다.
  • 비어 있는 의미적 레이아웃 예측을 방지하고 의미 있는 영역 분할을 보장하기 위해 자기 샘플링 정규화(SSR)를 적용한다.
  • 각 의미적 영역 내에서 독립적으로 인스턴스 정규화를 적용하여 특징 분포를 압축하고 영역 간 의미 일관성을 향상시킨다.
  • 기존 GAN 아키텍처에 AN을 플러그인 모듈로 통합하여 표준 정규화 레이어를 대체하거나 보완한다.
  • 의미적 엔티티 수 $ n $ 를 통해 영역 분할의 세밀함을 제어하며, 성능와 효율성의 균형을 고려해 $ n=16 $ 를 선택한다.
  • 전체 쌍방향 어텐션 계산을 피하고 국소화된 영역 기반 정규화에 의존함으로써 계산 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1학습 가능한 의미적 레이아웃 예측이 조건부 이미지 생성에서 장거리 특징 의존성 모델링을 향상시키는가?
  • RQ2의미적 유사성 기반의 영역별 인스턴스 정규화가 생성된 이미지의 구조적 일관성과 의미적 대응을 향상시키는가?
  • RQ3AN이 자기주의 GAN과 유사하거나 뛰어난 성능을 달성하면서도 계산 비용을 크게 줄일 수 있는가?
  • RQ4의미적 엔티티 수 $ n $ 는 생성된 이미지의 품질과 효율성에 어떤 영향을 미치는가?
  • RQ5자기 샘플링 정규화는 학습된 의미적 레이아웃의 품질과 후속 생성 결과를 얼마나 향상시키는가?

주요 결과

  • Attentive Normalization은 ImageNet (128×128)에서 클래스 조건부 이미지 생성에 대해 FID 17.84를 달성하며, 자기주의 GAN(18.65)과 장기 의존성 모델링이 없는 베이스라인 모델(22.96)을 모두 능가한다.
  • 동일한 모델 용량과 학습 설정에서 $ n=16 $ 일 때 AN은 Inception Score를 46.57로 향상시키고 FID를 17.84로 낮춰, 더 뛰어난 이미지 품질과 다양성을 보여준다.
  • 제거 실험에서 자기 샘플링 정규화(SSR)가 필수적임을 확인: 이를 제거하면 FID가 23.58로 상승하여 표준 인스턴스 정규화 수준에 근접한다.
  • AN은 뛰어난 계산 효율성을 보이며, 1024×1024 해상도에서 AN은 37.68ms 소요되나, 자기주의 기반 메커니즘은 GPU OOM로 측정 불가이며, AN은 선형으로 확장되고 자기주의는 제곱형으로 증가한다.
  • 파리 스트리트뷰에서의 생성 이미지 인painting 작업에서 AN은 PSNR 25.09, SSIM 0.8541, MAE 0.0334를 기록하며, CA 베이스라인보다 시각적 품질과 정량적 지표에서 모두 뛰어나다.
  • 제거 실험 결과, 영역 기반 정규화에서 인스턴스 정규화(IN)가 배치 정규화(BN)보다 우수하며, FID는 IN(17.84) 대비 BN(19.59)로 나타나, IN이 이 작업에 적합함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.