Skip to main content
QUICK REVIEW

[논문 리뷰] Make It So: Steering StyleGAN for Any Image Inversion and Editing

Anand Bhattad, Viraj Shah|arXiv (Cornell University)|2023. 04. 27.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

Make It So는 기존의 잠재 스타일 공간(W)이 아닌 노이즈 공간(Z)에서 작동하는 혁신적인 GAN 역설계 방법을 제안한다. 이는 더 높은 역설계 정확도와 편집 일관성을 달성하며, 잠재 코드 z와 생성기 가중치 θ′을 동시에 최적화함으로써 PTI보다 5배 높은 역설계 정확도와 10배 높은 편집 품질을 달성한다. 하나의 침실 기반으로 훈련된 StyleGAN 모델을 사용하여 얼굴, 차량, 동물과 같은 도메인 외 이미지도 일반화하여 처리할 수 있다.

ABSTRACT

StyleGAN's disentangled style representation enables powerful image editing by manipulating the latent variables, but accurately mapping real-world images to their latent variables (GAN inversion) remains a challenge. Existing GAN inversion methods struggle to maintain editing directions and produce realistic results. To address these limitations, we propose Make It So, a novel GAN inversion method that operates in the $\mathcal{Z}$ (noise) space rather than the typical $\mathcal{W}$ (latent style) space. Make It So preserves editing capabilities, even for out-of-domain images. This is a crucial property that was overlooked in prior methods. Our quantitative evaluations demonstrate that Make It So outperforms the state-of-the-art method PTI~\cite{roich2021pivotal} by a factor of five in inversion accuracy and achieves ten times better edit quality for complex indoor scenes.

연구 동기 및 목표

  • 실제 이미지, 특히 실내 방과 같은 복잡한 장면에서 정확하고 편집 일관성 있는 GAN 역설계 문제를 해결하기 위해.
  • 기존 방법들이 역설계 정확도를 위해 편집 일관성을 희생하는 문제를 해결하기 위해 Z-공간에서 W-공간 대신 작동함으로써.
  • 한 개의 도메인 특화 StyleGAN 모델을 사용하여 얼굴, 동물, 차량과 같은 도메인 외 이미지 간의 편집 방향을 일반화하기 위해.
  • 잠재 코드 z와 생성기 가중치 θ′을 동시에 학습하는 공동 최적화 프레임워크를 개발하여 역설계 정밀도와 편집 보존을 향상시키기 위해.
  • 학습 분포와 다른 도메인의 이미지를 역설계할 때도 앵커 및 서포트 손실을 통해 의미적 편집 방향을 유지할 수 있음을 보여주기 위해.

제안 방법

  • 실제 이미지를 잠재 공간에 역설계하기 위해 노이즈 벡터 z와 생성기 가중치 θ′을 동시에 최적화하는 방식으로, 단순히 피벗 w만 미세조정하는 것과는 다릅니다.
  • 편집 방향의 의미를 유지하기 위해 서로 다른 이미지 간에 잠재 공간 내 편집 벡터 s를 정렬함으로써 의미를 보존하는 앵커 손실을 도입합니다.
  • 도메인 외 입력에 대해서도 응용된 편집이 의미적으로 타당하고 현실적으로 유지되도록 보장하기 위해 서포트 손실을 사용합니다.
  • 세부 정보 복구 및 역설계 품질 향상을 위해 최대 1000회까지 연장된 반복 횟수를 사용하는 수정된 훈련 스케줄을 적용합니다.
  • StyleGAN의 내재된 이미지 우선순위를 활용하여 재학습이나 도메인 특화 적응 없이도 도메인 외 이미지에 대해 제로샷 편집을 가능하게 합니다.
  • 편집 방향이 더 안정적이고 이식 가능하기 때문에 Z-공간에서 작동함으로써 정확도와 편집 일관성 간의 상충관계를 피할 수 있습니다.

실험 결과

연구 질문

  • RQ1Z-공간에서의 GAN 역설계는 W-공간 방법에 비해 상당히 높은 정확도와 더 나은 편집 일관성을 달성할 수 있는가?
  • RQ2z와 생성기 가중치 θ′을 공동 최적화하면 표준 미세조정 방법에 비해 더 강력하고 일반화 가능한 역설계 및 편집이 가능한가?
  • RQ3침실 데이터로 훈련된 하나의 StyleGAN 모델이 얼굴, 동물, 차량과 같은 도메인 외 이미지를 성공적으로 역설계하고 편집할 수 있는가?
  • RQ4앵커 손실과 서포트 손실이 다양한 이미지 분포 간의 편집 의미를 어떻게 유지하는가?
  • RQ5최적화 스케줄을 연장하면 복잡한 장면에서 역설계 정밀도와 세부 정보 복구에 얼마나 기여하는가?

주요 결과

  • Make It So는 인지적 손실과 L2 재구성 손실을 기준으로 최신 기술인 PTI보다 5배 높은 역설계 정확도를 달성한다.
  • 복잡한 실내 장면에서 편집 품질이 10배 향상되었으며, 조명 재설정, 색상 변경 등의 더 현실적이고 의미적으로 일관된 편집이 가능하다.
  • 얼굴, 차량, 동물과 같은 도메인 외 이미지를 하나의 침실 기반으로 훈련된 StyleGAN 모델로도 실제로 역설계하고 편집할 수 있으며, 이는 이전 방법에서는 없던 능력이다.
  • 제거 실험 결과, 앵커 손실과 서포트 손실 둘 다 필수적임을 확인했다. 둘 중 하나를 제거하면 편집 일관성 또는 역설계 정확도가 떨어지며, 전체 파이프라인에서 최고의 성능을 기록한다.
  • 최대 1000회까지 연장된 최적화를 통해 고주파 영역(예: 테이블 램프, 질감 등)에서의 세부 정보 복구가 크게 향상되었다.
  • 가중치 적응(θ′)을 포함한 Z-공간에서의 공동 최적화는 학습 도메인과 거리가 먼 이미지를 역설계할 때조차도 W-공간 방법보다 편집 방향을 더 잘 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.