[논문 리뷰] PeRFception: Perception using Radiance Fields
이 논문은 Plenoxels 기반으로 한 첫 번째 대규모 암묵적 3D 표현 데이터셋인 PeRFception을 소개한다. Plenoxels은 메모리 효율적인 형식으로 2D 및 3D 정보를 통합적으로 압축하고, 사진처럼 사실적인 렌더링을 구현한다. 저자들은 이 암묵적 표현에 대해 직접적인 엔드 투 엔드 학습을 통해 분류 및 세분화 모델을 구현하였으며, 96.4%의 메모리 압축률과 새로운 배경 증강 기법을 통해 최신 성능을 달성하였다.
The recent progress in implicit 3D representation, i.e., Neural Radiance Fields (NeRFs), has made accurate and photorealistic 3D reconstruction possible in a differentiable manner. This new representation can effectively convey the information of hundreds of high-resolution images in one compact format and allows photorealistic synthesis of novel views. In this work, using the variant of NeRF called Plenoxels, we create the first large-scale implicit representation datasets for perception tasks, called the PeRFception, which consists of two parts that incorporate both object-centric and scene-centric scans for classification and segmentation. It shows a significant memory compression rate (96.4\%) from the original dataset, while containing both 2D and 3D information in a unified form. We construct the classification and segmentation models that directly take as input this implicit format and also propose a novel augmentation technique to avoid overfitting on backgrounds of images. The code and data are publicly available in https://postech-cvlab.github.io/PeRFception .
연구 동기 및 목표
- NeRF와 같은 암묵적 3D 표현을 위한 대규모 데이터셋 부족 문제를 해결한다.
- 인식 작업에 적합하지 않은 NeRF의 속도, 특징 일관성 및 이식성의 한계를 극복한다.
- 분류 및 세분화와 같은 후속 인식 작업에서 암묵적 표현(Plenoxels 기반)을 직접 처리할 수 있도록 한다.
- 기하학적 정보와 사진적 사실성 정보를 모두 유지하는 통합적이고 압축적이며 일관된 특징 표현을 개발한다.
- 과적합을 줄이기 위해 암묵적 공간에서 배경을 조작하는 새로운 배경 증강 전략을 도입한다.
제안 방법
- CO3D와 ScanNet이라는 두 개의 대규모 3D 데이터셋을 미분 가능 볼륨 렌더링 기반으로 Plenoxel 기반의 암묵적 표현으로 변환한다.
- 구면 조화 계수와 희소 볼록 격자를 사용하여 시점에 따라 달라지는 렌더링 및 기하학적 정보를 인코딩함으로써, 다양한 시점 간에 일관되고 구조화된 특징을 확보한다.
- 데이터 압축 기법을 적용하여 Plenoxel 크기를 96.4%까지 감소시키면서도 고정밀 재구성 및 인식 성능를 유지한다.
- 학습 중 배경 시점을 조작함으로써 일반화 능력을 향상시키고 과적합을 줄이는 새로운 증강 방법을 설계한다.
- 암묵적 Plenoxel 형식에 직접적으로 2D 이미지 분류, 3D 객체 분류, 3D 세분화 모델을 엔드 투 엔드로 학습시킨다.
- 표준 NeRF와 비교해 효율적인 특징 추출과 추론 가속화를 가능하게 하는 명시적 희소 볼록 격자를 활용한다.
실험 결과
연구 질문
- RQ1Plenoxels와 같은 암묵적 3D 표현이 다양한 인식 작업에 대한 통합 입력 형식으로 효과적으로 사용될 수 있는가?
- RQ2Plenoxel 표현의 메모리 압축이 후속 인식 성능에 어느 정도 영향을 미치는가?
- RQ3암묵적 공간에서의 배경 증강 기법이 분류 및 세분화 모델의 일반화 능력을 어떻게 향상시키는가?
- RQ4암묵적 표현에 직접적으로 학습된 엔드 투 엔드 모델이 명시적 3D 입력을 사용하는 모델과 경쟁 가능한 정확도를 달성할 수 있는가?
- RQ5Plenoxels의 구조화된 특징 표현이 다양한 시점 간에 일관되고 이식 가능한 인식을 어떻게 지원하는가?
주요 결과
- PeRFception 데이터셋은 원본 데이터셋 대비 96.4%의 메모리 압축률을 달성하면서도 사진적 사실성 렌더링 품질과 3D 기하학적 정확도를 유지한다.
- PeRFception-CO3D에 기반한 분류 모델은 14A에서 85.3%의 top-1 정확도를 기록했으며, 최적의 증강 설정에서 34C에서는 46.6%의 정확도를 달성했다.
- PeRFception-ScanNet 기반 세분화 모델은 34C 설정에서 평균 IoU가 92.7%를 기록하여 복잡한 실내 환경에서 강력한 일반화 능력을 입증했다.
- 제안된 배경 증강 기법은 저항력을 크게 향상시켜 일부 클래스에서 과적합을 줄이고 정확도를 최대 4.5% 향상시켰다.
- 암묵적 표현에 직접적인 엔드 투 엔드 학습이 2D 및 3D 인식 작업 전반에서 경쟁 가능한 성능을 내며, 직접적인 암묵적 입력 처리의 가능성을 입증했다.
- 시각화 결과는 고정밀 신규 시점 합성과 정확한 의미적 레이블링을 확인했으며, 오차 맵에서 PSNR 값이 30를 초과해 강력한 재구성 품질을 나타냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.