Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Contextual Video Compression

Jiahao Li, Bin Li|arXiv (Cornell University)|2021. 09. 30.
Advanced Image Processing Techniques참고 문헌 37인용 수 115
한 줄 요약

본 논문은 MEMC를 통해 학습된 고차원 피처 도메인 컨텍스트를 활용하는 조건부 코딩 프레임워크인 DCVC를 비디오 압축 맥락에서 제시하며, 기존의 DL 기반 방법 및 x265에 비해 상당한 비트레이트 절감을 달성한다. 학습 가능한 컨텍스트를 이용해 인코딩, 디코딩, 엔트로피 모델링을 공동으로 최적화한다.

ABSTRACT

Most of the existing neural video compression methods adopt the predictive coding framework, which first generates the predicted frame and then encodes its residue with the current frame. However, as for compression ratio, predictive coding is only a sub-optimal solution as it uses simple subtraction operation to remove the redundancy across frames. In this paper, we propose a deep contextual video compression framework to enable a paradigm shift from predictive coding to conditional coding. In particular, we try to answer the following questions: how to define, use, and learn condition under a deep video compression framework. To tap the potential of conditional coding, we propose using feature domain context as condition. This enables us to leverage the high dimension context to carry rich information to both the encoder and the decoder, which helps reconstruct the high-frequency contents for higher video quality. Our framework is also extensible, in which the condition can be flexibly designed. Experiments show that our method can significantly outperform the previous state-of-the-art (SOTA) deep video compression methods. When compared with x265 using veryslow preset, we can achieve 26.0% bitrate saving for 1080P standard test videos.

연구 동기 및 목표

  • 잔차 부호화를 넘어 비디오 압축을 위한 학습 가능한 컨텍스트(조건)를 정의하고 학습한다.
  • 인코더, 디코더, 엔트로피 모델에 통합적으로 영향을 주는 컨디셔닝 프레임워크를 설계한다.
  • 특히 고주파 성분의 재구성을 개선하기 위해 피처 도메인 모션 보정 컨텍스트를 활용한다.
  • 시간적 사전을 갖춘 조건부 코딩이 잔차 기반 접근법을 하이이 비트레이트-왜곡(R-D) 성능에서 능가한다는 것을 입증한다.

제안 방법

  • 현재 프레임을 이전에 디코딩된 프레임으로부터 피처 도메인 MEMC를 통해 도출된 학습 가능한 컨텍스트 bar{x}_t에 조건부로 인코딩하는 조건부 코딩 기반 프레임워크를 제안한다.
  • 컨텍스트를 픽셀 도메인 예측이 아닌 고차원 피처 도메인 정보로 정의하고, 이 컨텍스트가 인코더, 디코더, 엔트로피 모델에 feed되도록 한다.
  • 런트로피 모델에 시간적 사전과 하이퍼 프라이어 및 자기회귀 구성요소를 함께 사용하여 잠재 코드 분포와 비트레이트를 추정한다.
  • MEMC로 학습된 모션 벡터를 사용해 이전 프레임의 피처 추출 표현을 왜곡시켜 컨텍스트를 학습하고, 그 뒤 정제 네트워크로 bar{x}_t를 생성한다.
  • 손실 L = Λ D + R의 RD 목적함수로 학습하며, 여기서 D는 왜곡(MSE 또는 MS-SSIM), R은 교차 엔트로피 기반 비트레이트이다.

실험 결과

연구 질문

  • RQ1학습 가능한 고차원 컨텍스트가 간단한 잔차 뺄셈을 넘어서 프레임 간 코딩을 개선할 수 있는가?
  • RQ2더 나은 압축을 위해 컨텍스트 추출을 피처 공간에서 안내하기 위해 MEMC를 어떻게 통합할 수 있는가?
  • RQ3조건부 코딩에 가장 좋은 RD 성능을 내는 엔트로피 모델 아키텍처(하이퍼 프라이어, 자기회귀, 시간적 프라이어)는 무엇인가?
  • RQ4시간적 priors가 공간적 priors 없이도 더 빠르고 병렬화된 엔트로피 코딩을 가능하게 하는가?
  • RQ5DCVC가 해상도와 콘텐츠 유형에 걸쳐 최첨단 DL 기반 코덱 및 전통 코덱과 어떻게 비교되는가?

주요 결과

  • DCVC는 기존의 DL 기반 코덱 및 x265 veryslow에 비해 상당한 비트레이트 절감을 달성한다. 예: 1080p 표준 테스트 비디오에서 x265 veryslow 대비 26.0%를 달성했다.
  • DCVC는 테스트 데이터셋과 비트레이트에서 DVCPro를 능가하며, MCL-JCV 및 UVG(1080p)에서 PSNR 기준 BD-비트레이트 개선이 최대 26.0%에 이른다.
  • 고해상도 비디오에서 피처 도메인 컨텍스트가 고주파 콘텐츠를 위한 더 풍부한 정보를 담고 있어 더 큰 이득이 관찰된다.
  • 시간적 priors를 기반으로 한 엔트로피 모델은 공간적 priors 여부에 관계없이 경쟁력 있거나 우수한 성능을 보이며, 해 더하기 하이퍼 프라이어, 시간적 priors, 선택적 공간 priors를 결합했을 때 최상의 결과를 얻었다.
  • 악성 연구(Ablation) 결과, 컨텍스트 특징을 연결하는 것이 RGB 예측 조건보다 더 큰 이득을 주며, 시간적 priors는 특히 조건부 코딩에서 결과를 개선한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.