Skip to main content
QUICK REVIEW

[논문 리뷰] Inter-Frame Compression for Dynamic Point Cloud Geometry Coding

Anique Akhtar, Zhu Li|arXiv (Cornell University)|2022. 07. 25.
3D Shape Modeling and Analysis인용 수 7
한 줄 요약

이 논문은 동적 포인트 클라우드 기하 구조를 위한 딥러닝 기반 이중 프레임 압축 프레임워크를 제안하며, 계층적 다중스케일 희박 컨볼루션과 새로운 '대상 좌표에 대한 컨볼루션' 모듈을 활용하여 이전 프레임에서 현재 프레임의 특징을 예측한다. 이는 G-PCC 대비 91% 이상의 BD-Rate 감소와 V-PCC P-프레임 모드 대비 52%의 감소를 달성하여 VR 및 몰입형 원격 감시 응용 분야에서 손실 기하 구조 압축의 새로운 최고 성능을 설정한다.

ABSTRACT

Efficient point cloud compression is essential for applications like virtual and mixed reality, autonomous driving, and cultural heritage. This paper proposes a deep learning-based inter-frame encoding scheme for dynamic point cloud geometry compression. We propose a lossy geometry compression scheme that predicts the latent representation of the current frame using the previous frame by employing a novel feature space inter-prediction network. The proposed network utilizes sparse convolutions with hierarchical multiscale 3D feature learning to encode the current frame using the previous frame. The proposed method introduces a novel predictor network for motion compensation in the feature domain to map the latent representation of the previous frame to the coordinates of the current frame to predict the current frame's feature embedding. The framework transmits the residual of the predicted features and the actual features by compressing them using a learned probabilistic factorized entropy model. At the receiver, the decoder hierarchically reconstructs the current frame by progressively rescaling the feature embedding. The proposed framework is compared to the state-of-the-art Video-based Point Cloud Compression (V-PCC) and Geometry-based Point Cloud Compression (G-PCC) schemes standardized by the Moving Picture Experts Group (MPEG). The proposed method achieves more than 88% BD-Rate (Bjontegaard Delta Rate) reduction against G-PCCv20 Octree, more than 56% BD-Rate savings against G-PCCv20 Trisoup, more than 62% BD-Rate reduction against V-PCC intra-frame encoding mode, and more than 52% BD-Rate savings against V-PCC P-frame-based inter-frame encoding mode using HEVC. These significant performance gains are cross-checked and verified in the MPEG working group.

연구 동기 및 목표

  • 동적 환경을 위한 딥러닝 기반 포인트 클라우드 기하 구조 압축에서의 이중 예측 부족 문제를 해결하기 위해.
  • 밀도 높은 동적 포인트 클라우드에서 연속 프레임 간의 시간적 상관관계를 활용하여 압축 효율을 향상시키기 위해.
  • MPEG 표준화된 V-PCC와 G-PCC, 그리고 최신 딥러닝 기반 방법을 모두 능가하는 확장성 있고 저복잡도의 프레임워크를 개발하기 위해.
  • VR, MR 및 원격 감시 응용 분야에서의 실용적 구현을 가능하게 하기 위해 비트레이트를 감소시키면서도 높은 복원 품질을 유지하기 위해.

제안 방법

  • 새로운 예측 네트워크는 계층적 다중스케일 특징 학습을 갖춘 희박 3D 컨볼루션을 사용하여 이전 프레임의 잠재 표현을 기반으로 현재 프레임을 인코딩한다.
  • 이 방법은 '대상 좌표에 대한 컨볼루션'을 활용하여 이전 프레임의 특징을 현재 프레임의 다운샘플된 좌표로 매핑함으로써 정확한 특징 임bedding 예측을 가능하게 한다.
  • 예측된 특징과 실제 특징 간 잔차는 효율적인 전송을 위해 학습된 확률적 인화 모델을 사용하여 압축된다.
  • 디코더는 다중 해상도 재구성 경로를 통해 점진적으로 특징 임베딩을 확대함으로써 포인트 클라우드를 계층적으로 재구성한다.
  • 프레임 단위로 압축할 수 있도록 kd-트리 분할을 통한 블록 기반 인코딩을 지원하여 대규모 포인트 클라우드의 처리를 확장 가능하게 한다.
  • 이중 프레임 처리에도 불구하고 GPU 가속과 약 200만 파라미터의 컴act 네트워크를 통해 런타임 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 이중 프레임 예측 기법이 인트라-프레임 및 표준 이중 프레임 코덱 대비 동적 포인트 클라우드 기하 구조의 압축 효율을 크게 향상시킬 수 있는가?
  • RQ2제안된 '대상 좌표에 대한 컨볼루션' 모듈이 희박하고 비구조화된 포인트 클라우드 간에 특징 표현을 효과적으로 다음 프레임으로 전달할 수 있는가?
  • RQ3다양한 동적 포인트 클라우드 시퀀스에서 MPEG 표준화된 V-PCC와 G-PCC에 비해 제안된 방법이 BD-Rate 및 복원 품질 측면에서 얼마나 뛰어난가?
  • RQ4블록 기반 인코딩은 압축 성능에 어떤 영향을 미치며, 실질적으로 파일 분할 오버헤드가 유의미한가?

주요 결과

  • 제안된 방법은 모든 테스트 시퀀스에서 MPEG G-PCC(옥트리) 대비 91% 이상의 BD-Rate 감소를 달성한다.
  • 삼각형 기반 표면 근사화 방법을 사용한 G-PCC 대비 84% 이상의 BD-Rate 감소를 달성한다.
  • 최신 딥러닝 기반 인트라-프레임 방법인 PCGCv2에 비해 BD-Rate 감소가 34% 이상 향상된다.
  • V-PCC의 인트라-프레임 인코딩 모드 대비 62% 이상의 BD-Rate 향상이 이루어진다.
  • HEVC를 사용한 V-PCC의 P-프레임 기반 이중 프레임 모드 대비 52% 이상의 BD-Rate 향상이 이루어진다.
  • 최대 8개 블록까지의 블록 기반 인코딩은 PSNR를 74.56에서 74.35로 약간 감소시키며 비트레이트는 다소 증가하지만, 분할에 의한 성능 저하가 미미함을 보여주어 성능 저하가 거의 없음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.