[논문 리뷰] Style Generator Inversion for Image Enhancement and Animation
이 논문은 스타일 제너레이터의 새로운 역행렬 방법을 제안하여, 초해상도 및 애니메이션 분야에서 강력한 이미지 사전으로 활용할 수 있도록 한다. 스타일 제너레이터의 잠재 공간에서의 역행성과 선형 분리 가능성에 기반하여, 학습 없이 1024×1024 해상도에서 비지도적 얼굴 재생동작을 수행하며, 이는 이전의 GAN 및 딥 이미지 사전보다 이미지 복원 작업에서 뛰어난 성능을 보인다.
One of the main motivations for training high quality image generative models is their potential use as tools for image manipulation. Recently, generative adversarial networks (GANs) have been able to generate images of remarkable quality. Unfortunately, adversarially-trained unconditional generator networks have not been successful as image priors. One of the main requirements for a network to act as a generative image prior, is being able to generate every possible image from the target distribution. Adversarial learning often experiences mode-collapse, which manifests in generators that cannot generate some modes of the target distribution. Another requirement often not satisfied is invertibility i.e. having an efficient way of finding a valid input latent code given a required output image. In this work, we show that differently from earlier GANs, the very recently proposed style-generators are quite easy to invert. We use this important observation to propose style generators as general purpose image priors. We show that style generators outperform other GANs as well as Deep Image Prior as priors for image enhancement tasks. The latent space spanned by style-generators satisfies linear identity-pose relations. The latent space linearity, combined with invertibility, allows us to animate still facial images without supervision. Extensive experiments are performed to support the main contributions of this paper.
연구 동기 및 목표
- 기존 GAN의 역행성 부족 및 모드 붕괴 문제로 인해 이미지 사전로 사용이 제한되는 문제를 해결하기 위해.
- 스스로의 적대적 훈련에도 불구하고 스타일 제너레이터 제너레이터는 역행성이 있으며, 높은 정밀도로 실제 이미지를 재구성할 수 있음을 입증하기 위해.
- 스타일 제너레이터의 잠재 공간에서 신원과 자세가 선형적으로 분리되어 있음을 활용하여 비지도적 얼굴 애니메이션을 수행하기 위해.
- 초해상도 및 인painting과 같은 이미지 향상 작업에서 스타일 제너레이터를 최첨단 이미지 사전으로 정립하기 위해.
- 잠재 코드 조작을 통해 영상에서 운동을 추출하여 정적 이미지에 적용함으로써 학습 없이 즉시 사용 가능한 얼굴 재생동작을 가능하게 하기 위해.
제안 방법
- 시각적 손실과 L2 정규화를 사용하여 잠재 코드를 최적화함으로써 실제 이미지를 역행성으로 재구성, 분포 내 이미지 재구성 가능.
- 스타일 제너레이터의 분리된 잠재 공간을 활용하여 신원과 자세가 선형적으로 분리되어 있어 의미적 편집이 가능하도록 함.
- 프레임 간 자세 코드의 차이를 계산하여 소스 영상의 얼굴 운동을 타겟 정적 이미지의 신원 코드에 적용함.
- 최적화된 잠재 코드 시퀀스에 이동 평균 필터를 적용하여 밝기 및 배경 잡음 요소를 줄이고 운동의 매끄러움을 확보함.
- 전체 잠재 코드 입력보다 더 높은 재구성 품질을 확보하기 위해 각 레이어별로 하나의 잠재 코드를 사용하는 레이어별 잠재 코드 최적화 방법을 적용함.
- 수정된 잠재 코드를 사전 훈련된 스타일 제너레이터에 통과시켜 애니메이션 영상을 생성함.
실험 결과
연구 질문
- RQ1적대적 훈련과 모드 붕괴에도 불구하고 스타일 제너레이터 제너레이터는 실제 이미지를 효과적으로 역행성으로 재구성할 수 있는가?
- RQ2스타일 제너레이터의 잠재 공간에서 신원과 자세의 선형 분리 가능성은 어느 정도의 수준까지 가능한가?
- RQ3역행성 있는 스타일 제너레이터는 초해상도 및 인painting과 같은 이미지 향상 작업에서 강력한 이미지 사전으로 사용될 수 있는가?
- RQ4잠재 코드 조작만으로 감독 없이 영상의 운동을 정적 이미지로 전달할 수 있는가?
- RQ5제안된 방법은 고해상도(1024×1024)에서 고정밀도, 학습 없이 얼굴 재생동작을 달성할 수 있는가?
주요 결과
- 스타일 제너레이터 제너레이터는 잠재 최적화를 통해 역행성이 확보되어, 분포 내 샘플에서도 고정밀도로 실제 이미지를 재구성할 수 있다.
- LPIPS 측정 기준으로 이전의 GAN 기반 사전 및 딥 이미지 사전보다 이미지 초해상도 및 인painting 벤치마크에서 뚜렷한 성능 향상을 보였다.
- 잠재 공간에서 신원과 자세의 선형 분리 가능성을 활용하여 1024×1024 해상도에서 신뢰할 수 있는 비지도적 얼굴 재생동작이 가능하다.
- 감독 없이도 잠재 코드의 차이와 이동 평균 필터를 활용하여 잡음 요소를 줄이고 운동 전이가 성공적으로 수행되었다.
- 레이어별 잠재 코드 최적화 방법은 전체 잠재 코드 입력보다 더 높은 재구성 품질을 제공하며, 향후 모델의 아키텍처 개선에 기여할 잠재력을 보였다.
- 최적화된 잠재 코드를 사용하여 실사 이미지에서 속성 전환을 성공적으로 수행하여 감독 없이도 의미적 제어가 가능함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.