Skip to main content
QUICK REVIEW

[논문 리뷰] DiffuStereo: High Quality Human Reconstruction via Diffusion-based Stereo Using Sparse Cameras

Ruizhi Shao, Zerong Zheng|arXiv (Cornell University)|2022. 07. 16.
Advanced Vision and Imaging인용 수 4
한 줄 요약

DiffuStereo는 하위 픽셀 정확도로 깊이 맵을 반복적으로 정밀하게 조정하는 확산 기반 스테레오 모듈을 도입하여 오직 여덟 개의 흩어진 RGB 카메라만을 사용하여 3D 인간 재구성 시스템을 제안한다. 이 방법은 고밀도 카메라 랙 수준의 고품질이고 세밀한 3D 재구성을 달성하며, 하위 밀리미터 재구성 정확도에서 최신 기술보다 42% 이상 뛰어나고, 거친 초기 모델 대비 54.4% 감소한 Chamfer 거리로 우수한 성능을 보인다.

ABSTRACT

We propose DiffuStereo, a novel system using only sparse cameras (8 in this work) for high-quality 3D human reconstruction. At its core is a novel diffusion-based stereo module, which introduces diffusion models, a type of powerful generative models, into the iterative stereo matching network. To this end, we design a new diffusion kernel and additional stereo constraints to facilitate stereo matching and depth estimation in the network. We further present a multi-level stereo network architecture to handle high-resolution (up to 4k) inputs without requiring unaffordable memory footprint. Given a set of sparse-view color images of a human, the proposed multi-level diffusion-based stereo network can produce highly accurate depth maps, which are then converted into a high-quality 3D human model through an efficient multi-view fusion strategy. Overall, our method enables automatic reconstruction of human models with quality on par to high-end dense-view camera rigs, and this is achieved using a much more light-weight hardware setup. Experiments show that our method outperforms state-of-the-art methods by a large margin both qualitatively and quantitatively.

연구 동기 및 목표

  • 현재 학습 기반 방법들이 외관 정보에 의존함으로써 흩어진 시야의 RGB 카메라에서 고정밀 3D 인간 재구성을 달성하지 못하는 문제를 해결하기 위해.
  • 기존 스테레오 매칭 방법의 한계—예를 들어 이산 비용 볼륨과 낮은 해상도—를 극복하기 위해 확산 모델을 반복적 스테레오 매칭에 통합하여 연속적이고 하위 픽셀 정밀도의 정밀 조정을 가능하게 하기 위해.
  • 고해상도(최대 4K) 입력을 처리할 수 있는 메모리 효율적인 다중 수준 네트워크 아키텍처를 설계하기 위해.
  • 교정 오차와 음영을 다룰 수 있는 경량 스테레오 매칭 전략과 경량 다중 시야 융합 전략을 조합하여 경량 하드웨어에서도 고정밀 3D 재구성을 가능하게 하기 위해.

제안 방법

  • 고유한 확산 커널과 스테레오 제약 조건을 사용하여 2D 흐름 도메인에서 비율 흐름을 반복적으로 정밀 조정하는 새로운 확산 기반 스테레오 모듈을 도입한다.
  • 전체 네트워크 아키텍처는 전역 수준과 확산 수준의 두 수준으로 구성되며, 전역 수준은 압축된 이미지에서 의미적 특징을 추출하고, 확산 수준은 이러한 특징을 확산 기반 스테레오 네트워크에 통합하여 반복적 정밀 조정을 수행한다.
  • 다중 시야 특징과 에피포라 제약 조건에 따라 조건화된 확산 네트워크는 스테레오 일致성과 흩어진 시야 환경에서의 기하학적 정확도 향상을 보장한다.
  • 고해상도 입력을 처리할 때 발생하는 메모리 병목 현상을 완화하기 위해 두 수준 아키텍처에서 패치 기반 학습 전략을 채택한다.
  • 정밀 조정된 깊이 포인트 클라우드를 비틀림 없는 ICP를 통해 거친 인간 모델과 정렬하고, 교정 오차와 음영을 다룰 수 있도록 깊이 맵을 융합하는 효율적인 다중 시야 융합 전략을 적용한다.
  • 시스템은 먼저 DoubleField에 의해 생성된 거친 3D 인간 메시에서 시작되며, 이를 바탕으로 초기 깊이 맵과 비율 흐름을 렌더링하여 확산 정밀 조정에 활용한다.

실험 결과

연구 질문

  • RQ1확산 모델은 흩어진 시야의 RGB 입력에서 고정밀 3D 인간 재구성을 위해 스테레오 매칭에 효과적으로 적응할 수 있는가?
  • RQ2확산 기반 스테레오 매칭은 메모리 비용이 과도하게 증가하지 않도록 하면서도 고해상도(4K) 입력을 처리하면서 하위 픽셀 정확도를 달성할 수 있는가?
  • RQ3기존의 반복적 스테레오 또는 암묵적 학습 방법에 비해 확산 기반 스테레오 모듈은 기하학적 세부 정보와 재구성 정확도를 어느 정도 향상시킬 수 있는가?
  • RQ4실제 흩어진 시야 환경에서 초기 모델 오차와 교정 정확도 부족에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • DoubleField가 생성한 거친 모델에 비해 Chamfer 거리는 54.4% 감소하고, P2S 오차는 44.1% 감소하여 기하학적 정확도 향상이 뚜렷하게 입증되었다.
  • 하위 밀리미터 재구성 정확도에서 이전 최신 기술보다 42% 이상 뛰어나며, 미세한 기하학적 세부 정보를 유지하는 데서의 우수성을 입증하였다.
  • 제안된 확산 기반 스테레오 네트워크는 단지 여덟 대의 카메라로도 흩어진 시야 조건에서도 하위 픽셀 정확도를 달성하는 고품질 깊이 맵을 생성하였다.
  • 단지 30단계의 역방향 처리만으로도 여덟 시야에 대해 약 12초 내에 고품질 결과를 생성하여 원래 1000단계 확산 모델 대비 95%의 속도 향상을 달성하였다.
  • 제거 분석 결과, 제안된 확산 커널이 원래 커널보다 더 안정적이고 정확하며, 일부 경우에 노이즈가 많은 결과를 생성했던 원래 커널보다 우수함을 확인하였다.
  • 여덟 시야에서 생성된 시각 헐로 초기화 상태에서도, 가시 영역 내에서 미세한 기하학적 세부 정보를 성공적으로 복원하여 거친 초기 기하학에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.