[논문 리뷰] FOF: Learning Fourier Occupancy Field for Monocular Real-time Human Reconstruction
이 논문은 3D 인간 자세를 시야 방향에 따라 점유도를 표현하는 푸리에 급수를 사용해 2D 이미지에 정렬된 필드로 표현하는 새로운 3D 기하 구조 표현인 푸리에 점유도 필드(FOF)를 제안한다. FOF를 다중 채널 이미지로 저장함으로써, 최신 기술 수준의 정확도를 유지하면서도 30+ FPS로 실시간, 엔드 투 엔드 단일 영상 재구성가능하며, 2D 컨볼루션 네트워크와 호환되며 메쉬로 쉽게 변환 가능하다.
The advent of deep learning has led to significant progress in monocular human reconstruction. However, existing representations, such as parametric models, voxel grids, meshes and implicit neural representations, have difficulties achieving high-quality results and real-time speed at the same time. In this paper, we propose Fourier Occupancy Field (FOF), a novel powerful, efficient and flexible 3D representation, for monocular real-time and accurate human reconstruction. The FOF represents a 3D object with a 2D field orthogonal to the view direction where at each 2D position the occupancy field of the object along the view direction is compactly represented with the first few terms of Fourier series, which retains the topology and neighborhood relation in the 2D domain. A FOF can be stored as a multi-channel image, which is compatible with 2D convolutional neural networks and can bridge the gap between 3D geometries and 2D images. The FOF is very flexible and extensible, e.g., parametric models can be easily integrated into a FOF as a prior to generate more robust results. Based on FOF, we design the first 30+FPS high-fidelity real-time monocular human reconstruction framework. We demonstrate the potential of FOF on both public dataset and real captured data. The code will be released for research purposes.
연구 동기 및 목표
- 단일 영상에서 고품질 실시간 3D 인간 재구성을 달성하는 데 도전한다.
- 기존 표현 방식—예: 매개변수 기반 모델, 복셀 격자, 메쉬, 암시적 신경 필드—의 한계를 극복하기 위해 효율성, 정확도, 호환성의 통합을 도모한다.
- 2D 이미지와 3D 기하 구조를 연결하면서도 빠른 추론과 메쉬 추출 기능을 제공하는 3D 표현을 설계한다.
- 단순하고 엔드 투 엔드 학습 파이프라인을 통해 실시간 재구성(30+ FPS)을 가능하게 하며 고해상도 결과를 제공한다.
- SMPL과 같은 사전 지식과의 탄력적 통합과 FOF와 메쉬 간의 원활한 변환을 지원한다.
제안 방법
- FOF는 입력 이미지에 정렬된 2D 필드로 3D 물체를 표현하며, 시야 방향의 점유도는 푸리에 급수의 첫 번째 몇 항을 통해 표현된다.
- 3D 점유도 필드는 z방향에서 밴드리미티드 함수로 근사되어 메모리 사용량을 줄이고 위상적 구조를 유지한다.
- FOF는 다중 채널 이미지로 저장되어 2D 컨볼루션 신경망과의 호환성을 보장하여 효율적인 추론이 가능하다.
- 신경망은 이미지-이미지 회귀 헤드를 사용해 단일 영상에서 FOF를 예측함으로써 엔드 투 엔드 학습이 가능하다.
- 메쉬는 재구성된 점유도 필드에 대해 마르칭 큐브를 적용하여 추출되며, FOF와 메쉬 간의 양방향 변환이 지원된다.
- 매개변수 기반 모델(예: SMPL)은 정확도 향상과 일반화 능력 향상을 위해 사전 지식으로 통합될 수 있다.
실험 결과
연구 질문
- RQ1고해상도 재구성과 실시간 추론을 동시에 달성할 수 있는 2D에 정렬된 3D 표현을 설계할 수 있는가?
- RQ2시야 방향에 따라 점유도 필드를 푸리에 급수로 표현함으로써 기하학적 세부 정보를 유지하면서도 효율적인 계산과 메쉬 추출이 가능한가?
- RQ3암시적 신경 필드 및 메쉬 기반 방법과 비교해 FOF는 속도, 정확도, 딥러닝 프레임워크 호환성 측면에서 어떻게 성능을 내는가?
- RQ4FOF는 매개변수 기반 모델과의 통합과 메쉬 간의 양방향 변환을 지원할 수 있는가?
- RQ5복잡한 인간 자세와 의복을 포함한 복잡한 형태에서도 품질 손실 없이 FOF가 실시간 성능(30+ FPS)을 달성할 수 있는가?
주요 결과
- 제안된 FOF 표현은 30+ FPS로 실시간 단일 영상 인간 재구성을 달성했으며, 속도 측면에서 이전 방법들을 능가하면서도 고해상도 재구성 품질을 유지한다.
- 테스트 세트에서 FOF는 비교된 방법들 중에서 카프너 거리와 P2S 거리가 가장 낮았으며, PIFuHD에 비해 정규 이미지 오차만 약간 높았다.
- N=15개의 푸리에 계수를 사용한 FOF가 가장 많은 기하학적 세부 정보를 유지했고, N≤12일 경우 눈에 띄는 아티팩트가 발생하여 충분한 조화 성분의 중요성을 확인했다.
- 시각적 결과는 FOF가 다양한 자세와 의복 세부 정보를 안정적으로 재구성하며, 밴드리미티드 근사로 인해 고주파 노이즈가 감소한 것을 보여준다.
- FOF와 메쉬 간의 원활한 변환 기능이 가능하며, SMPL을 사전 지식으로 통합해 정확도 향상에 기여한다.
- FOF 기반 파이프라인은 엔드 투 엔드 학습이 가능하고 표준 2D CNN과 호환되어 3DTV 및 홀로그램 원격 시청 시스템에 효율적으로 구현 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.