[논문 리뷰] GRAM-HD: 3D-Consistent Image Generation at High Resolution with Generative Radiance Manifolds
GRAM-HD는 학습된 레이디안 매니폴드 위의 2D 컨볼루션 네트워크를 통해 3D 공간에서 초해상도를 수행함으로써, 다중 시점 일致성을 철저히 유지하면서 최대 1024×1024 해상도의 이미지를 생성하는 3D 인식 GAN을 제안한다. 이는 이전 방법 대비 메모리 사용량과 추론 비용을 줄이며, 이미지 품질과 3D 일치성에서 최신 기준을 달성한다.
Recent works have shown that 3D-aware GANs trained on unstructured single image collections can generate multiview images of novel instances. The key underpinnings to achieve this are a 3D radiance field generator and a volume rendering process. However, existing methods either cannot generate high-resolution images (e.g., up to 256X256) due to the high computation cost of neural volume rendering, or rely on 2D CNNs for image-space upsampling which jeopardizes the 3D consistency across different views. This paper proposes a novel 3D-aware GAN that can generate high resolution images (up to 1024X1024) while keeping strict 3D consistency as in volume rendering. Our motivation is to achieve super-resolution directly in the 3D space to preserve 3D consistency. We avoid the otherwise prohibitively-expensive computation cost by applying 2D convolutions on a set of 2D radiance manifolds defined in the recent generative radiance manifold (GRAM) approach, and apply dedicated loss functions for effective GAN training at high resolution. Experiments on FFHQ and AFHQv2 datasets show that our method can produce high-quality 3D-consistent results that significantly outperform existing methods. It makes a significant step towards closing the gap between traditional 2D image generation and 3D-consistent free-view generation.
연구 동기 및 목표
- 비정형 2D 이미지 컬렉션에서부터 고해상도(최대 1024×1024)의 3D 일치성 이미지 생성을 가능하게 하기 위해.
- 고해상도 3D 인식 GAN에서 신경 볼륨 렌더링의 계산 병목 현상을 해결하기 위해.
- 이미지 공간에서의 2D 컨볼루션 네트워크를 통한 업샘플링을 피하면서도 엄격한 3D 일치성을 유지하면서 초해상도를 달성하기 위해.
- 이미지 품질이나 일치성에 손상을 주지 않으면서도 기존 3D 인식 GAN에 비해 메모리 사용량과 추론 비용을 줄이기 위해.
제안 방법
- 객체 기하학과 레이디안을 표현하는 3D 표면 매니폴드를 정의하기 위해 생성 레이디안 매니폴드(GRAM) 프레임워크를 활용한다.
- 매니폴드를 평탄화하고 2D 격자에 샘플링한 후, 공유된 2D CNN을 사용하여 업샘플링 및 특징에서 레이디안으로의 변환을 수행함으로써 초해상도를 수행한다.
- 고해상도 출력에서 칸막이 무늬 아티팩트를 억제하기 위해 패치 기반 적대적 손실($\mathcal{L}_{\mathrm{patch}}$)을 도입한다.
- 학습을 안정화하고 부정확한 아티팩트(예: 떠 있는 물체)를 방지하기 위해 교차 해상도 일치 손실($\mathcal{L}_{\mathrm{cons}}$)을 적용한다.
- 스타일 조절 기능이 내장된 공유 생성 네트워크와 별도의 배경 레이디안 네트워크를 사용하여 현실감을 향상시킨다.
- 저해상도 매니폴드에서 시작하여 점진적으로 고해상도 출력으로 정밀화하는 다중 해상도 학습 전략을 적용한다.

실험 결과
연구 질문
- RQ13D 인식 GAN은 엄격한 다중 시점 일치성을 유지하면서 고해상도(1024×1024) 이미지를 생성할 수 있는가?
- RQ2비싼 3D 컨볼루션 또는 이미지 공간의 2D 업샘플링에 의존하지 않고도 효율적인 3D 초해상도를 달성할 수 있는가?
- RQ3고해상도에서 적대적 학습을 안정화하여 칸막이 무늬나 부정확한 물체와 같은 아티팩트를 방지할 수 있는가?
- RQ4고해상도 정밀화 과정에서 3D 일치성과 이미지 품질을 유지하는 데 가장 효과적인 손실 함수는 무엇인가?
- RQ53D 인식 GAN의 계산 비용을 품질 손실 없이 크게 줄일 수 있는가?
주요 결과
- GRAM-HD는 FFHQ-256²에서 프리셰트 인ception 디스턴스(FID)를 11.8로 달성하여 기준선인 GRAM 방법 대비 21% 감소시켰다.
- 1024×1024 생성에 대한 추론 시간이 이전 방법 대비 95% 감소하여 뚜렷한 효율성 향상을 보였다.
- 256×256 해상도에서 메모리 사용량은 76% 감소했으며, GRAM에 비해 추론 시간도 58% 감소했다.
- 패치 적대적 손실($\mathcal{L}_{\mathrm{patch}}$)은 고해상도 출력에서의 칸막이 무늬 아티팩트를 효과적으로 제거했다.
- 교차 해상도 일치 손실($\mathcal{L}_{\mathrm{cons}}$)은 앞쪽에 떠 있는 물체와 같은 부정확한 아티팩트를 방지했다.
- 캐시된 메시 표현을 활용하여 1024×1024 해상도에서 실시간 자유 시점 합성(90 FPS)을 달성했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.