[논문 리뷰] HyperInverter: Improving StyleGAN Inversion via Hypernetwork
HyperInverter는 고해상도 재구성과 높은 편집 가능성, 빠른 추론을 동시에 달성하는 두 단계, 인코더 기반 방식의 StyleGAN 역행렬 기반 방법을 제안한다. 먼저 이미지를 StyleGAN2의 W-공간으로 인코딩하여 편집 가능성을 확보하고, 이후 하이퍼넷워크를 이용해 보정된 가중치를 예측하여 생성기의 성능을 향상시킨다. 이 과정에서 추론 중 최적화나 미세조정을 필요로 하지 않아도 손실된 세부 정보를 복원할 수 있다.
Real-world image manipulation has achieved fantastic progress in recent years as a result of the exploration and utilization of GAN latent spaces. GAN inversion is the first step in this pipeline, which aims to map the real image to the latent code faithfully. Unfortunately, the majority of existing GAN inversion methods fail to meet at least one of the three requirements listed below: high reconstruction quality, editability, and fast inference. We present a novel two-phase strategy in this research that fits all requirements at the same time. In the first phase, we train an encoder to map the input image to StyleGAN2 $\mathcal{W}$-space, which was proven to have excellent editability but lower reconstruction quality. In the second phase, we supplement the reconstruction ability in the initial phase by leveraging a series of hypernetworks to recover the missing information during inversion. These two steps complement each other to yield high reconstruction quality thanks to the hypernetwork branch and excellent editability due to the inversion done in the $\mathcal{W}$-space. Our method is entirely encoder-based, resulting in extremely fast inference. Extensive experiments on two challenging datasets demonstrate the superiority of our method.
연구 동기 및 목표
- W-공간은 편집 가능성을 보장하지만 재구성 품질이 떨어지며, W+는 더 나은 재구성 품질을 제공하지만 편집 가능성이 떨어지는 GAN 역행렬의 재구성-편집 간 상충 문제를 해결한다.
- 최적화 기반 또는 미세조정 기반 역행렬 방법의 높은 추론 비용 문제를 해결하여 실시간 또는 상호작용형 응용 분야에 적합하게 한다.
- 최적의 최적화 기반 방법인 PTI 수준의 재구성 품질을 달성하면서도, 추론 속도를 유지하는 완전한 인코더 기반 방법을 개발한다.
- 잠재 코드와 생성기 가중치를 동시에 보간함으로써 고품질의 이미지 보간을 가능하게 하여, 시각적 일관성과 세부 정보 유지도 향상시킨다.
제안 방법
- 첫 번째 단계: 사전 학습된 StyleGAN2 생성기의 W-공간으로 실사 이미지를 매핑하기 위해 표준 인코더를 사용하여 높은 편집 가능성을 확보한다.
- 두 번째 단계: 여러 하이퍼넷워크를 활용해 생성기 원본 파라미터를 보정하는 잔차 가중치를 예측한다. 이는 W-공간 인코딩 과정에서 손실된 세부 정보를 복원한다.
- 하이퍼넷워크는 입력 이미지와 초기 재구성 결과에 조건이 되어 생성기의 합성곱 레이어에 대한 계층별 잔차 업데이트를 생성한다.
- 예측된 잔차 가중치로 업데이트된 개선된 생성기는 최종 재구성 이미지를 합성하며, W-공간의 편집 가능성과 향상된 재구성 정확도를 동시에 확보한다.
- 이 방법은 추론 중 각 이미지에 대한 최적화나 생성기 미세조정을 필요로 하지 않아 근접 실시간 성능을 달성한다.
- 잠재 코드와 생성기 가중치를 동시에 보간하는 새로운 보간 방법을 도입하여, 이미지 간 전환의 시각적 품질을 향상시켰다.
실험 결과
연구 질문
- RQ1완전한 인코더 기반 방법이 PTI와 같은 최적화 기반 방법 수준의 재구성 품질을 달성하면서도 빠른 추론 속도를 유지할 수 있는가?
- RQ2하이퍼넷워크가 각 이미지 최적화나 생성기 미세조정 없이 W-공간 역행렬 과정에서 손실된 세부 정보를 효과적으로 복원할 수 있는가?
- RQ3잠재 코드와 생성기 가중치를 동시에 보간하는 것이 기존의 잠재 코드 보간 방식보다 더 매끄럽고 현실적인 이미지 전환을 이끌 수 있는가?
- RQ4하이퍼넷워크의 은닉 차원 D 또는 업데이트되는 레이어의 선택과 같은 아키텍처 선택이 재구성 품질과 세부 정보 복원에 어떤 영향을 미치는가?
주요 결과
- HyperInverter는 추론 속도가 3000배 빠르면서도 PTI(현재 최고 수준의 최적화 기반 방법) 수준의 재구성 품질을 달성한다.
- 하이퍼넷워크를 활용한 두 번째 단계는 필수적이다. 제거한 경우의 추론 분석 결과, 얼굴 메이크업, 그림자, 배경 등 세부 정보가 손실되는 심각한 품질 저하가 발생한다.
- 계층별 외관 코드를 사용하는 전체 하이퍼넷워크 설계가, 레이어 간 공유 코드나 입력 이미지 특징만 사용하는 단순화된 버전보다 우수한 성능을 보였다.
- 하이퍼넷워크의 은닉 차원 D=256일 때 최고의 성능을 보였으며, 추론 분석 결과 더 작은 값이나 더 큰 값은 결과를 떨어뜨린다.
- 잔차 가중치 업데이트가 주 생성기 블록과 가장 높은 해상도(1024×1024)에서 가장 두드러지게 영향을 미치며, 이는 두 번째 단계가 세밀한 얼굴 세부 정보 복원에 집중함을 확인한다.
- 잠재 코드와 생성기 가중치를 동시에 보간하는 제안된 보간 방법은 더 매끄럽고 현실적인 전환을 만들어내며, 헤어스타일이나 손의 세부 정보 등도 기존의 잠재 코드 보간 방식보다 더 잘 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.