[논문 리뷰] 3D Former: Monocular Scene Reconstruction with 3D SDF Transformers
이 논문은 3D SDF 트랜스포머 네트워크인 3D Former을 제안하며, 단일 뷰 환경에서의 3D 장면 재구성에서 3D CNN을 대체하기 위해 희소 창 다중 헤드 어텐션 메커니즘을 도입한다. 기하학적 구조 유지 및 장거리 맥락을 위한 확장된 어텐션과 글로벌 모듈을 도입함으로써, ScanNet에서 메시 정확도 오차를 41.8% 감소시키고 완전성 오차를 25.3% 감소시켜 최신 기술 수준의 성능을 달성한다.
Monocular scene reconstruction from posed images is challenging due to the complexity of a large environment. Recent volumetric methods learn to directly predict the TSDF volume and have demonstrated promising results in this task. However, most methods focus on how to extract and fuse the 2D features to a 3D feature volume, but none of them improve the way how the 3D volume is aggregated. In this work, we propose an SDF transformer network, which replaces the role of 3D CNN for better 3D feature aggregation. To reduce the explosive computation complexity of the 3D multi-head attention, we propose a sparse window attention module, where the attention is only calculated between the non-empty voxels within a local window. Then a top-down-bottom-up 3D attention network is built for 3D feature aggregation, where a dilate-attention structure is proposed to prevent geometry degeneration, and two global modules are employed to equip with global receptive fields. The experiments on multiple datasets show that this 3D transformer network generates a more accurate and complete reconstruction, which outperforms previous methods by a large margin. Remarkably, the mesh accuracy is improved by 41.8%, and the mesh completeness is improved by 25.3% on the ScanNet dataset. Project page: https://weihaosky.github.io/sdfformer.
연구 동기 및 목표
- 큰 복잡한 환경에서 카메라 자세가 알려진 RGB 이미지로부터 정확하고 완전한 단일 뷰 3D 장면 재구성을 달성하는 데 도전한다.
- 3D CNN의 3D 특징 집합에서의 한계를 극복하기 위해 더 효과적인 어텐션 기반 메커니즘으로 3D CNN을 대체한다.
- 대규모 3D 재구성 작업에 적합하게 3D 다중 헤드 어텐션의 계산 복잡도를 낮춘다.
- 새로운 아키텍처 구성 요소를 통해 3D 특징 학습에서 기하학적 구조 유지 및 장거리 의존성 모델링을 향상시킨다.
- ScanNet 및 TUM-RGBD와 같은 벤치마크 데이터셋에서 메시 정확도 및 완전성에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 지역화된 3D 창 내에서 비어 있지 않은 복셀 간에만 어텐션을 계산하는 희소 창 다중 헤드 어텐션 모듈을 제안하여 계산 비용을 크게 감소시킨다.
- 상향-하향 아키텍처의 3D 트랜스포머 아키텍처에서 다운샘플링 및 업샘플링 과정에서 기하학적 구조 손실을 방지하기 위해 확장 어텐션 메커니즘을 도입한다.
- 2D 특징을 역투영한 특징을 조합하기 위한 코arse-to-fine 특징 집합을 위한 3단계 상향-하향 3D 트랜스포머 네트워크를 설계한다.
- 장거리 의존성 및 장면 수준의 이해를 향상시키기 위해 하단 레벨에 글로벌 어텐션 모듈과 글로벌 컨텍스트 인코딩 모듈을 통합한다.
- 3D 표현으로 截斷된 부호 거리 함수(TSDF)를 사용하고, 최종 표면은 Marching Cubes를 통해 예측한다.
- 모든 네트워크를 엔드 투 엔드로 훈련하여 카메라 자세가 알려진 단일 뷰 RGB 이미지 시퀀스로부터 TSDF 볼륨을 회귀하도록 한다.

실험 결과
연구 질문
- RQ1희소 창 어텐션을 갖춘 3D 트랜스포머가 단일 뷰 장면 재구성에서 3D CNN보다 더 나은 3D 특징 집합을 달성할 수 있는가?
- RQ2대규모 3D 재구성 작업에 적합하게 3D 다중 헤드 어텐션을 계산적으로 가능하게 만들 수 있는가?
- RQ3상향-하향 아키텍처의 3D 트랜스포머 아키텍처에서 확장 어텐션을 사용하면 기하학적 세부 사항을 유지하고 형태의 열화를 방지할 수 있는가?
- RQ4하단 레벨에 글로벌 모듈을 도입하면 희소 3D 특징 볼륨에서 장거리 맥락 모델링을 향상시킬 수 있는가?
- RQ53D CNN을 3D 트랜스포머로 대체함으로써 메시 정확도 및 완전성에서 얼마나 향상될 수 있는가?
주요 결과
- 제안된 3D Former은 ScanNet 데이터셋에서 메시 정확도 오차를 41.8% 상대적으로 감소시켜 0.055에서 0.032로 감소시켰다.
- ScanNet 데이터셋에서 메시 완전성 오차는 25.3% 향상되어 0.083에서 0.062로 감소하였다.
- 제거 실험 결과, 글로벌 모듈과 후행 확장 어텐션 블록의 추가가 완전성 향상과 세부 사항 복원에 크게 기여하는 것으로 확인되었다.
- 희소 창 어텐션에서 창 크기 10이 성능과 계산 비용 간 최적의 균형을 이룬다.
- ICL-NUIM 및 TUM-RGBD 데이터셋에서 이전 최신 기술 수준의 방법들인 NeuralRecon 및 VoRTX를 초월하는 성능을 여러 지표에서 확보하였다.
- 정성적 결과에서는 일부 경우에서 재구성된 메시가 실제값보다 더 조밀하고 정확하며 더 완전하며, 미세한 세부 사항을 더 잘 유지하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.