Skip to main content
QUICK REVIEW

[논문 리뷰] Region-Based Semantic Factorization in GANs

Jiapeng Zhu, Yujun Shen|arXiv (Cornell University)|2022. 02. 19.
Generative Adversarial Networks and Image Synthesis인용 수 14
한 줄 요약

이 논문은 애너테이션이나 훈련 없이도 임의의 이미지 영역에 대응하는 분리된 의미 방향을 생성하는 잠재 공간에서 탐지하는 지역 기반 의미 분해 방법인 ReSeFa를 제안한다. 국소적 편집을 일반화된 Rayleigh 몫을 통한 이중 최적화 문제로 공식화함으로써, ReSeFa는 다양한 GAN 아키텍처에서 빠르고 강건하며 정밀한 국소 편집을 가능하게 하며, 제어 정확도, 영역 충실도, 추론 속도 측면에서 기존 방법들을 능가한다.

ABSTRACT

Despite the rapid advancement of semantic discovery in the latent space of Generative Adversarial Networks (GANs), existing approaches either are limited to finding global attributes or rely on a number of segmentation masks to identify local attributes. In this work, we present a highly efficient algorithm to factorize the latent semantics learned by GANs concerning an arbitrary image region. Concretely, we revisit the task of local manipulation with pre-trained GANs and formulate region-based semantic discovery as a dual optimization problem. Through an appropriately defined generalized Rayleigh quotient, we manage to solve such a problem without any annotations or training. Experimental results on various state-of-the-art GAN models demonstrate the effectiveness of our approach, as well as its superiority over prior arts regarding precise control, region robustness, speed of implementation, and simplicity of use.

연구 동기 및 목표

  • 기존 GAN 의미 탐지 방법이 전반적인 특성에 국한되거나 국소 특성을 위해 세그멘테이션 마스크가 필요하다는 한계를 해결하기 위해.
  • 사전 훈련된 GAN 내에서 임의의 이미지 영역에 대해 정밀하고 강건하며 애너테이션 없이 국소 의미 요소를 탐지하기 위해.
  • 국소적 편집을 의미 분해의 사전 조건으로 통합함으로써 다양한 GAN 모델 간의 제어성과 일반화 능력을 향상시키기 위해.
  • 초기화 파라미터나 모델 전용 구조에 의존하지 않도록 하여 광범위한 적용 가능성을 확보하기 위해.

제안 방법

  • 픽셀 출력의 잠재 코드에 대한 자코비안을 기반으로 지역 기반 의미 분해를 이중 최적화 문제로 공식화한다.
  • 최적화 목표를 일반화된 Rayleigh 몫으로 재구성하여 고유분해를 통한 효율적 해법을 가능하게 한다.
  • 세부 세그멘테이션 마스크나 애너테이션의 필요 없이, 대상 영역 주변의 대략적인 바운딩 박스만 사용한다.
  • 고유분해 문제를 해결하여, 나머지 이미지의 내용을 유지하면서도 특정 영역만 변경하는 잠재 방향을 식별한다.
  • 재훈련이나 미세조정 없이도 StyleGAN2와 BigGAN를 포함한 다양한 GAN에 적용한다.
  • GAN 생성기의 자코비안의 내재 기하학적 특성을 활용하여 영역 특화의 고해상도 편집을 보장한다.

실험 결과

연구 질문

  • RQ1세그멘테이션 마스크나 애너테이션 없이도, 임의의 이미지 영역에 대응하는 분리된 의미 요소를 GAN에서 탐지할 수 있는가?
  • RQ2대상 영역 외부의 콘텐츠를 유지하면서도 강건하고 정밀한 국소적 편집을 어떻게 보장할 수 있는가?
  • RQ3통일된, 훈련이 없는 방법을 통해 다양한 GAN 아키텍처에서 빠르고 일반화 가능한 의미 분해를 달성할 수 있는가?
  • RQ4제안된 방법은 StyleSpace나 LowRankGAN와 같은 최첨단 국소 편집 기반 방법들과 비교해 성능과 안정성에서 어떻게 뛰어나게 되는가?

주요 결과

  • 모든 평가된 특성에서 ReSeFa는 편집 후 가장 높은 아이덴티티 유사도(ID)를 기록하여 전반적인 얼굴 구조의 우수한 유지 능력을 보여준다.
  • 비교 방법들 중에서 가장 짧은 탐지 시간을 기록하여, 효율적인 고유분해 공식화 덕분으로 추론 속도가 빠르다.
  • 정량적 결과에서 비대상 영역(‘out’)의 MSE가 낮아, 편집 과정에서 비대상 콘텐츠의 보존 능력이 뛰어남을 확인한다.
  • 시각적 품질과 정량적 지표 모두에서 ReSeFa는 StyleSpace와 LowRankGAN를 능가하며, 배경과 주변 영역에 대한 의도치 않은 변화를 최소화하는 데 특히 뛰어나다.
  • StyleGAN2와 BigGAN를 포함한 다양한 GAN에서 뛰어난 일반화 능력을 유지하며 강력한 성능을 발휘한다.
  • ReSeFa는 최소한의 잡음으로 눈과 입을 제대로 닫는 데 성공하여, 기존 기반 모델에서 관찰되는 턱 변형이나 배경 색상 이동 등의 문제를 피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.