Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Implicit Volume Compression

Danhang Tang, Saurabh Singh|arXiv (Cornell University)|2020. 05. 18.
Advanced Vision and Imaging참고 문헌 60인용 수 5
한 줄 요약

이 논문은 4D 볼륨 데이터 내의 잘린 부호 거리 필드(TSDF) 및 관련 텍스처를 위한 딥러닝 기반 압축 프레임워크를 제안한다. 엔드 투 엔드로 훈련 가능한 블록 기반 신경망과 엔트로피 코딩, 손실 없는 부호 압축을 사용한다. 기존 최고 수준의 방법들과 비교해 비트레이트를 66% 감소시키거나 왜곡을 50% 감소시키며, 공간-시간적으로 일관된 텍스처 매핑을 통해 기하학적 및 텍스처 적으로 뛰어난 정밀도를 확보한다.

ABSTRACT

We describe a novel approach for compressing truncated signed distance fields (TSDF) stored in 3D voxel grids, and their corresponding textures. To compress the TSDF, our method relies on a block-based neural network architecture trained end-to-end, achieving state-of-the-art rate-distortion trade-off. To prevent topological errors, we losslessly compress the signs of the TSDF, which also upper bounds the reconstruction error by the voxel size. To compress the corresponding texture, we designed a fast block-based UV parameterization, generating coherent texture maps that can be effectively compressed using existing video compression algorithms. We demonstrate the performance of our algorithms on two 4D performance capture datasets, reducing bitrate by 66% for the same distortion, or alternatively reducing the distortion by 50% for the same bitrate, compared to the state-of-the-art.

연구 동기 및 목표

  • AR/VR 및 자유 시점 영상 응용 분야에서 4D 볼륨 재구성의 높은 메모리 사용량 문제를 해결하기 위해.
  • 기존 방법들인 Tang 등 [59] 및 Draco와 비교해 압축된 TSDF 볼륨의 비율-왜곡 성능을 향상시키기 위해.
  • TSDF 부호의 손실 없는 압축을 통해 복원 오차를 볼륨 크기로 제한하고 표면의 위상 구조를 유지하기 위해.
  • UV 좌표 압축 없이도 공간-시간적으로 일관된 텍스처 매핑을 보장하는 텍스처 매핑 방법을 설계하기 위해.
  • 4D 성능 캡처를 위한 기하학적 및 텍스처 압축을 통합된 엔드 투 엔드로 훈련 가능한 시스템으로 통합하기 위해.

제안 방법

  • 학습된 엔트로피 모델링을 사용하는 블록 기반 3D 컨volution 오토인코더를 활용해 TSDF 볼륨의 엔드 투 엔드 압축을 수행한다.
  • TSDF 부호의 손실 없는 압축을 위해 조건부 사전 분포 $ p_{\mathbf{s}|\hat{\mathbf{z}}} $ 를 적용하여, 복원 오차가 볼륨 크기로 제한됨을 보장한다.
  • 모르탄 패킹된 차트를 사용하는 새로운 블록 기반 UV 매핑 기법을 도입하여 텍스처 맵의 공간-시간적 일관성을 향상시킨다.
  • 일관된 텍스처 맵에 표준 영상 코덱(예: H.264)을 적용하여 별도의 UV 좌표 압축을 피한다.
  • 등치면 근처의 오차를 강조하기 위해 표면 인식 기반 왜곡 손실 함수를 사용해 네트워크를 훈련한다.
  • 합성 압축 파이프라인을 사용하여 인코더는 양자화된 코드 $ \hat{\mathbf{z}} $ 를 출력하고, 디코더는 $ \hat{\mathbf{x}} = \mathbf{s} \odot |\mathcal{D}(\hat{\mathbf{z}})| $ 를 통해 재구성한다.

실험 결과

연구 질문

  • RQ1학습된 엔드 투 엔드 압축 모델이 기존 방법들과 비교해 4D TSDF 데이터에서 뛰어난 비율-왜곡 성능을 달성할 수 있는가?
  • RQ2TSDF 부호의 손실 없는 압축이 복원 오차와 위상 정확도에 어떤 영향을 미치는가?
  • RQ3모르탄 팩킹을 사용하는 블록 기반 텍스처 매핑이 추적 또는 UV 좌표 전송 없이도 압축 효율을 향상시킬 수 있는가?
  • RQ4표준 영상 코덱을 사용할 때, 텍스처 맵의 공간-시간적 일관성이 비트레이트 감소에 얼마나 기여하는가?
  • RQ5기하학적 및 텍스처 압축을 하나의 파이프라인으로 통합하면 별도 처리보다 전체 성능이 향상되는가?

주요 결과

  • Tang 등 [59]의 최고 수준 방법과 비교해 동일한 왜곡 수준에서 비트레이트를 66% 감소시켰다.
  • 동일한 비트레이트에서 제안된 방법은 Tang 등 [59] 대비 왜곡을 50% 감소시켜 뛰어난 비율-왜곡 성능을 입증했다.
  • TSDF 부호의 손실 없는 압축은 복원 오차를 볼륨 크기로 제한하고 재구성된 표면의 위상 정확도를 보장한다.
  • 제안된 텍스처 매핑은 평균 350 KB의 비트레이트로 PSNR 30.9를 달성하여 UVAtlas [71] 및 단순한 박스 패킹 기반 베이스라인보다 더 뛰어난 압축 효율성을 확보했다.
  • 낮은 비트레이트에서도 렌더링된 텍스처에 눈에 띄는 아티팩트가 없이 높은 시각적 품질을 유지하며, 정성적 비교에서 이를 확인했다.
  • 단일 GPU에서 엔드 투 엔드 추론 시간이 20ms로 측정되어 실시간 응용 분야에서 실용적인 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.