[논문 리뷰] In&Out : Diverse Image Outpainting via GAN Inversion
이 논문은 입력 이미지 경계를 초월해 의미적으로 일관되고 고품질의 확장을 생성하는 GAN 역행 기반 프레임워크인 In&Out을 제안한다. 공간 좌표에 조건화된 마이크로패치 생성과 다중 잠복 코드 최적화를 통해, 질감 반복 없이 사용자 제어가 가능한 분류 기반의 구조적 다양성을 갖춘 고품질 확장 결과를 달성한다.
Image outpainting seeks for a semantically consistent extension of the input image beyond its available content. Compared to inpainting -- filling in missing pixels in a way coherent with the neighboring pixels -- outpainting can be achieved in more diverse ways since the problem is less constrained by the surrounding pixels. Existing image outpainting methods pose the problem as a conditional image-to-image translation task, often generating repetitive structures and textures by replicating the content available in the input image. In this work, we formulate the problem from the perspective of inverting generative adversarial networks. Our generator renders micro-patches conditioned on their joint latent code as well as their individual positions in the image. To outpaint an image, we seek for multiple latent codes not only recovering available patches but also synthesizing diverse outpainting by patch-based generation. This leads to richer structure and content in the outpainted regions. Furthermore, our formulation allows for outpainting conditioned on the categorical input, thereby enabling flexible user controls. Extensive experimental results demonstrate the proposed method performs favorably against existing in- and outpainting methods, featuring higher visual quality and diversity.
연구 동기 및 목표
- 기존 이미지 확장 방법이 결정론적이고 맥락 유출이 발생하는 I2I 번역으로 인해 반복적인 질감과 다양성 부족 문제를 해결하기 위해.
- 좌표 조건화된 마이크로패치 생성을 통해 GAN 역행 문제를 재구성함으로써 다중 모달, 다양한 확장을 가능하게 하기 위해.
- 목표 장면 확장을 위한 분류 조건화를 통해 사용자 제어의 유연성을 제공하기 위해.
- 아티팩트나 경계 실개 없이 고해상도의 구조적 풍부함을 갖춘 확장 결과를 달성하기 위해.
- 반복 패tern이 최소화된 복잡한 패노라마 이미지 생성을 위해 재귀적 확장을 가능하게 하기 위해.
제안 방법
- 공통 전역 잠복 코드와 개별 패치 좌표에 조건화된 공간적으로 일관된 마이크로패치를 생성하도록 수정된 StyleGAN2 생성기 학습.
- 확장 과정은 입력 이미지를 재구성하면서도 확장 영역에 다양한 콘텐츠를 합성하는 데 다중 잠복 코드를 찾기 위해 생성기의 역행을 수행함.
- 재현 손실, 지각 손실, 다양성 증진 손실(Lms 및 Ldiv)을 포함하는 다중 손실 최적화 프레임워크로 현실성과 다양성의 균형을 확보.
- 사전 훈련된 생성기의 만능성 내에 유지되는 것을 보장하는 사전 정규화 손실(Lprior)으로 아티팩트와 분포 이탈을 방지.
- 분류 레이블에 조건화된 생성기로 분류 조건화를 도입하여, 확장 영역에서 특정 객체나 장면 요소의 제어된 생성을 가능하게 함.
- 이전에 확장된 마이크로패치를 새로운 역행 대상으로 간주함으로써 재귀적 확장을 가능하게 하여 패노라마 이미지 합성 지원.
실험 결과
연구 질문
- RQ1입력 이미지 경계를 초월해 다양한 고품질의 이미지 확장을 효과적으로 생성하기 위해 GAN 역행을 활용할 수 있는가?
- RQ2결정론적 이미지 간 번역에 의존하지 않고 이미지 확장에서 다중 모달 생성을 어떻게 달성할 수 있는가?
- RQ3좌표 조건화된 마이크로패치 생성이 의미적으로 일관되고 반복적이지 않은 구조적 확장을 가능하게 할 수 있는가?
- RQ4사용자 제어 가능한 분류 조건화가 확장 영역의 구조와 콘텐츠를 얼마나 잘 이끌 수 있는가?
- RQ5역행을 통한 재귀적 확장을 통해 반복 패턴이 최소화된 복잡한 대규모 패노라마를 생성할 수 있는가?
주요 결과
- 제안된 방법은 아티팩트가 적고 더 현실적인 장면 확장을 제공함으로써 기준 방법 대비 뛰어난 시각적 품질과 다양성을 달성한다.
- Lprior의 포함으로 분포 이탈을 방지하여 현실성이 크게 향상되어 확장 영역에서 눈에 띄는 실개나 입력 복제 현상이 발생하지 않는다.
- 다양성 손실(Lms 및 Ldiv)은 재구성 품질에 영향을 주지 않으면서도 서로 다른 잠복 코드를 효과적으로 유도하여 다양한 확장 솔루션을 도출한다.
- 분류 기반 확장은 특정 객체 삽입이나 사용자 제공 분류 레이블에 기반한 풍경 구조 수정과 같은 목표 지향적 장면 편집을 가능하게 한다.
- 재귀적 확장은 반복 패턴이 최소화되고 높은 구조적 복잡성을 갖춘 고품질 패노라마를 성공적으로 생성한다.
- 사용자 연구와 FID 점수는 In&Out가 기존 방법보다 현실성에서 뛰어남을 확인하였으며, LPIPS 점수는 다양성 향상이 뚜렷하게 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.