[논문 리뷰] LSAP: Rethinking Inversion Fidelity, Perception and Editability in GAN Latent Space
LSAP는 생성기의 잠재공간의 합성 분포와 역추론된 잠재 코드를 정렬함으로써 GAN 역추론에서 인지성과 편집 가능성 향상을 위한 새로운 잠재공간 정렬 역추론 철학을 제안한다. 이는 정규화된 스타일 공간(S^N)과 정규화된 스타일 공간 코사인 거리(NSCD)를 도입하여 기하학적이고 미분 가능한 메트릭과 최적화 손실을 제공하며, 인코더 기반 및 최적화 기반 방법 모두에서 정밀도, 인지성, 편집 가능성 측면에서 최신 기술 수준의 성능을 달성한다.
As research on image inversion advances, the process is generally divided into two stages. The first step is Image Embedding, involves using an encoder or optimization procedure to embed an image and obtain its corresponding latent code. The second stage, referred to as Result Refinement, further improves the inversion and editing outcomes. Although this refinement stage substantially enhances reconstruction fidelity, perception and editability remain largely unchanged and are highly dependent on the latent codes derived from the first stage. Therefore, a key challenge lies in obtaining latent codes that preserve reconstruction fidelity while simultaneously improving perception and editability. In this work, we first reveal that these two properties are closely related to the degree of alignment (or disalignment) between the inverted latent codes and the synthetic distribution. Based on this insight, we propose the extbf{ Latent Space Alignment Inversion Paradigm (LSAP)}, which integrates both an evaluation metric and a unified inversion solution. Specifically, we introduce the extbf{Normalized Style Space ($\mathcal{S^N}$ space)} and extbf{Normalized Style Space Cosine Distance (NSCD)} to quantify the disalignment of inversion methods. Moreover, our paradigm can be optimized for both encoder-based and optimization-based embeddings, providing a consistent alignment framework. Extensive experiments across various domains demonstrate that NSCD effectively captures perceptual and editable characteristics, and that our alignment paradigm achieves state-of-the-art performance in both stages of inversion.
연구 동기 및 목표
- 역추론된 잠재 코드가 합성 잠재공간 분포와의 정렬에 의해 제약을 받는 인지성과 편집 가능성의 한계를 해결하기 위해.
- 편집 벡터에 독립적인 잠재 코드 수준에서 인지성과 편집 가능성을 정량적으로 반영할 수 있는 통합된, 미분 가능한 메트릭을 개발하기 위해.
- 재구성 정밀도를 훼손하지 않으면서 인코더 기반 및 최적화 기반 역추론 방법 모두에 적용 가능한 일반화 가능한 정렬 솔루션을 설계하기 위해.
- 잠재공간 정렬을 향상시킴으로써 이미지 품질과 편집 가능성이 크게 향상됨을 입증하기 위해.
제안 방법
- Z, W 또는 S 공간보다 더 효과적이고 효율적인 잠재공간으로서 정규화된 스타일 공간(S^N)을 도입하여 이질성 정도를 측정하기 위해.
- 잠재 코드 수준에서 정규화된 스타일 공간 코사인 거리(NSCD)를 도입하여, 역추론된 코드와 합성 분포 사이의 이질성 정도를 정량화하는 기하학적이고 미분 가능한 메트릭으로서의 역할을 수행하기 위해.
- NSCD 기반의 정렬 손실을 제안하여, 인코더 학습 및 최적화 기반 역추론 모두에서 최적화가 가능하도록 하기 위해.
- NSCD 기반 정렬 손실을 인코더 기반 및 최적화 기반 역추론 프레임워크에 동일하게 적용하여 인지성과 편집 가능성을 향상시키기 위해.
- 기존의 이중 단계 방법들(HFGI, SAM, PTI 등)에 LSAP 철학을 통합하여 성능을 추가로 향상시키기 위해.
- 낮은 NSCD 값이 더 나은 이미지 품질과 편집 결과를 의미함을 검증하기 위해 NSCD를 프oxy 메트릭으로 사용하기 위해.
실험 결과
연구 질문
- RQ1역추론된 잠재 코드가 합성 분포와의 정렬 정도가 GAN 역추론에서 인지성과 편집 가능성에 어떤 영향을 미치는가?
- RQ2다양한 역추론 방법에 걸쳐 잠재 코드 수준에서 인지성과 편집 가능성을 평가할 수 있는 통합된, 미분 가능한 메트릭을 개발할 수 있는가?
- RQ3잠재공간 정렬을 향상시킴으로써 재구성 품질이 떨어지지 않으면서 정밀도와 편집 가능성이 얼마나 향상될 수 있는가?
- RQ4제안된 정렬 솔루션은 인코더 기반 및 최적화 기반 역추론 방법 모두에 효과적으로 적용될 수 있는가?
- RQ5실제로 NSCD 메트릭은 인지 품질과 편집 가능성을 신뢰성 있게 반영하는가?
주요 결과
- LSAP는 인간 얼굴, 자동차, 성당, 야생 동물 등 다양한 도메인에서 정밀도와 편집 가능성 측면에서 최신 기술 수준의 성능을 달성한다.
- NSCD 메트릭은 인지 품질과 편집 가능성과 효과적으로 상관관계를 가지며, 낮은 NSCD 값일수록 더 나은 이미지 품질과 더 자연스러운 편집 결과를 의미한다.
- 최적화 기반 역추론에서 LSAP는 W 및 W+ 공간 모두에서 기존의 단순 투영 방식이 자연스럽지 않은 세부 사항을 유도하는 문제를 크게 개선하여 편집 가능성과 이미지 품질을 향상시킨다.
- LSAP E는 인코더 기반 변종으로서 pSp와 유사한 재구성 정밀도를 달성하면서도 e4e에 비해 인지성과 편집 가능성에서 뚜렷한 승리를 거두었다.
- HFGI, SAM, PTI와 같은 이중 단계 방법과 결합할 경우 LSAP는 최신 기술 수준의 성능을 달성하여 그 일반화 가능성과 효과성을 입증하였다.
- 시각적 결과에서는 특히 편집 작업에서 기존 기준 방법보다 신원 보존과 세부 사항(예: 반사, 안경 등) 유지 능력이 뛰어나다는 점이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.