[논문 리뷰] CIPS-3D: A 3D-Aware Generator of GANs Based on Conditionally-Independent Pixel Synthesis
CIPS-3D는 얕은 NeRF를 3D 모양으로, 깊은 INR을 외관으로 사용하여 각 픽셀을 독립적으로 렌더링하는 스타일 기반의 3D-인식 생성기를 도입하여 FFHQ에서 최첨단의 3D 인식 이미지 품질을 달성합니다.
The style-based GAN (StyleGAN) architecture achieved state-of-the-art results for generating high-quality images, but it lacks explicit and precise control over camera poses. The recently proposed NeRF-based GANs made great progress towards 3D-aware generators, but they are unable to generate high-quality images yet. This paper presents CIPS-3D, a style-based, 3D-aware generator that is composed of a shallow NeRF network and a deep implicit neural representation (INR) network. The generator synthesizes each pixel value independently without any spatial convolution or upsampling operation. In addition, we diagnose the problem of mirror symmetry that implies a suboptimal solution and solve it by introducing an auxiliary discriminator. Trained on raw, single-view images, CIPS-3D sets new records for 3D-aware image synthesis with an impressive FID of 6.97 for images at the $256 imes256$ resolution on FFHQ. We also demonstrate several interesting directions for CIPS-3D such as transfer learning and 3D-aware face stylization. The synthesis results are best viewed as videos, so we recommend the readers to check our github project at https://github.com/PeterouZh/CIPS-3D
연구 동기 및 목표
- 고충실도 3D-인식 이미지 합성에서 카메라 포즈에 대한 명시적 제어를 촉진한다.
- 각 픽셀을 독립적으로 합성하여 업샘플링/컨볼루션을 피하는 생성기를 제안한다.
- 메모리 효율성(얕은 NeRF)과 고용량 외관 모델링(깊은 INR)을 균형 있게 조율한다.
- 보조 판별기를 통해 3D-인식 GAN에서의 대칭 거울 현상을 다룬다.
- FFHQ에서 다른 도메인으로의 전이 학습과 3D-인식 얼굴 스타일링을 시연한다.
제안 방법
- 노이즈 조건화된 Modulated SIREN 블록으로 3D 형상을 포착하는 얕은 NeRF 네트워크를 사용한다.
- 형상 코드 z_s를 매핑 네트워크를 통해 w_s로 매핑하여 피처 모듈레이션을 수행하도록 NeRF를 조건화한다.
- NeRF가 각 점마다 3D 특징 벡터 v와 밀도 sigma를 출력하도록 하며, 부피 렌더링으로 픽셀별 특징을 생성한다.
- 픽셀별 특징을 독립적으로 RGB 값으로 변환하는 딥 2D INR 네트워크를 사용한다(공간적 업샘플링 없음).
- 고정된 위치 부호화로 인한 대칭을 피하기 위해 학습 가능한 위치 인코딩을 도입하고, NeRF 출력의 정규화를 위한 보조 판별기를 사용한다.
- 한 번의 반복에 레이의 일부에 대해서만 그래디언트 흐름을 활성화하여 고해상도 이미지를 효율적으로 학습하기 위해 부분 그래디언트 역전파를 구현한다.
- appearance modulation 속도를 높이기 위해 배치 행렬 곱(BMM)을 통한 메모리 효율적 ModFC 구현을 제공한다.
실험 결과
연구 질문
- RQ1얕은 NeRF + 깊은 INR인 하이브리드 생성기가 명시적 포즈 제어를 갖춘 고품질의 3D 인식 이미지 합성을 달성할 수 있는가?
- RQ2보조 판별기가 NeRF+INR 3D-인식 GAN에서 대칭 거울 현상을 효과적으로 완화하는가?
- RQ3공간 컨볼루션이나 업샘플링 없이 고해상도 3D-인식 GAN을 효율적으로 학습시킬 수 있는가?
- RQ4전이 학습이 새로운 도메인에 대해 모양 지식(NeRF)을 얼마나 잘 전달하고 외관을 미세조정하는가?
- RQ5대칭 문제 완화에서 학습 가능한 위치 인코딩과 고정 위치 인코딩의 상대적 이점은 무엇인가?
주요 결과
- CIPS-3D는 FFHQ에서 3D-인식 GAN 중 최첨단 FID/KID를 달성하며, 6.97 (2562) 및 12.26 (10242) FID와 2.87 (2562) 및 7.74 (10242) KID를 기록한다.
- StyleNeRF와 비교했을 때, 파라미터 수가 더 많음에도 2562에서 더 나은 FID/KID를 보이며, 더 높은 해상도에서도 경쟁력을 유지한다.
- 보조 판별기가 NeRF 기반 생성기에서 좌표 대칭에서 발생하는 거울 대칭을 효과적으로 제거한다.
- 부분 그래디언트 역전파는 메모리 사용량을 줄이면서 전체 이미지 판별기에 노출을 유지해 5122 해상도로 학습을 가능하게 한다.
- NeRF(형상) 네트워크를 동결하고 INR(외관)을 미세조정하여 새로운 도메인에 적응시키는 전이 학습이 효과적이다(MetFaces, BitmojiFaces, CartoonFaces, AFHQ).
- 기본 FFHQ 모델과 전이된 모델 간의 보간은 제어 가능한 3D-인식 스타일링 및 도메인 혼합을 야기한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.