Skip to main content
QUICK REVIEW

[논문 리뷰] Versatile Learned Video Compression

Runsen Feng, Zongyu Guo|arXiv (Cornell University)|2021. 11. 05.
Video Coding and Compression Technologies참고 문헌 40인용 수 5
한 줄 요약

이 논문은 3D 볼록 흐름을 통한 운동 보정과 다항식 기반의 흐름 예측을 사용하여 단일 참조 프레임, 양방향, 다중 참조 프레임을 포함한 모든 상호 예측 모드를 지원하는 통합 딥러닝 프레임워크인 Versatile Learned Video Compression (VLVC)을 제안한다. VLVC는 VVC/H.266 표준보다 MS-SSIM 성능이 뛰어나며, 이는 MS-SSIM 기준으로 VVC를 초월한 최초의 엔드 투 엔드 학습된 비디오 코덱이다.

ABSTRACT

Learned video compression methods have demonstrated great promise in catching up with traditional video codecs in their rate-distortion (R-D) performance. However, existing learned video compression schemes are limited by the binding of the prediction mode and the fixed network framework. They are unable to support various inter prediction modes and thus inapplicable for various scenarios. In this paper, to break this limitation, we propose a versatile learned video compression (VLVC) framework that uses one model to support all possible prediction modes. Specifically, to realize versatile compression, we first build a motion compensation module that applies multiple 3D motion vector fields (i.e., voxel flows) for weighted trilinear warping in spatial-temporal space. The voxel flows convey the information of temporal reference position that helps to decouple inter prediction modes away from framework designing. Secondly, in case of multiple-reference-frame prediction, we apply a flow prediction module to predict accurate motion trajectories with unified polynomial functions. We show that the flow prediction module can largely reduce the transmission cost of voxel flows. Experimental results demonstrate that our proposed VLVC not only supports versatile compression in various settings, but also is the first end-to-end learned video compression method that outperforms the latest VVC/H.266 standard reference software in terms of MS-SSIM.

연구 동기 및 목표

  • 기존의 학습된 비디오 코덱이 고정된 예측 모드와 네트워크 아키텍처에 묶여 있는 한계를 극복하기 위해.
  • 낮은 지연(일방향) 및 랜덤 액세스(양방향) 구성과 같은 다양한 코딩 시나리오를 하나의 모델이 지원할 수 있도록 하기 위해.
  • 예측 정확도를 훼손하지 않으면서 다중 참조 프레임 예측에서 운동 정보를 전송하는 데 드는 비트 비용을 줄이기 위해.
  • 모든 상호 예측 모드에서 경쟁적인 비율-왜곡 성능를 달성하여 기존 표준(예: VVC)과 맞추거나 능가하기 위해.

제안 방법

  • 다양한 3D 운동 벡터 필드(볼록 흐름)를 사용하여 공간-시간 운동을 표현함으로써, 어떤 참조 프레임이든 유연한 상호 예측를 가능하게 하는 볼록 흐름 기반 운동 보정 모듈을 도입한다.
  • 다중 볼록 흐름을 사용하여 가중치가 부여된 선형 외삽을 적용하여 타겟 프레임 픽셀을 합성함으로써, 단일 흐름 방법보다 운동 보정 정확도를 향상시킨다.
  • 운동 궤적을 균일하게 모델링하기 위해 다항식 기반의 흐름 예측 모듈을 도입하여 전체 볼록 흐름을 전송할 필요를 줄이고 인코딩 비용을 낮춘다.
  • 예측 모드를 네트워크 설계에서 분리하는 통합 아키텍처를 사용하여 엔드 투 엔드로 훈련함으로써, 모든 가능한 상호 예측 모드를 지원할 수 있도록 한다.
  • 운동 정보는 학습된 엔트로피 모델을 사용하여 인코딩되며, 단일 및 다중 참조 프레임 모두에서 일관된 성능을 제공한다.
  • 표준 HEVC 및 VVC 테스트 시퀀스를 사용하여 평가되었으며, 공정한 비교를 보장하기 위해 일관된 사전 처리 및 평가 파이프라인을 적용하였다.

실험 결과

연구 질문

  • RQ1단일 학습된 비디오 압축 모델이 아키텍처 재학습 없이도 일방향, 양방향, 다중 참조 프레임을 포함한 모든 상호 예측 모드를 지원할 수 있는가?
  • RQ2공간 및 시간적으로 임의의 참조 프레임 위치를 다룰 수 있도록 운동 보정을 얼마나 민첩하게 설계할 수 있는가?
  • RQ3다항식 함수 기반의 통합 흐름 예측 모듈이 운동 정보의 비트 비용을 줄이면서도 높은 예측 정확도를 유지할 수 있는가?
  • RQ4제안된 프레임워크가 최신 VVC/H.266 표준보다 더 나은 비율-왜곡 성능를 달성하는가, 특히 인지적 품질(예: MS-SSIM) 측면에서?
  • RQ5모델이 아키텍처 변경 없이도 낮은 지연 및 랜덤 액세스와 같은 다양한 코딩 구성에 일반화될 수 있는가?

주요 결과

  • VLVC는 테스트된 모든 시퀀스에서 VVC/H.266 참조 소프트웨어를 MS-SSIM 기준으로 초월한 최초의 엔드 투 엔드 학습된 비디오 압축 모델이다.
  • 다중 볼록 흐름과 가중치가 부여된 선형 외삽을 사용함으로써 운동 보정 정확도가 향상되어 잔여 에너지가 감소하고 더 효율적인 압축이 가능해졌다.
  • 다항식 기반의 흐름 예측 모듈은 특히 다중 참조 프레임 환경에서 운동 정보 전송에 드는 비트 비용을 크게 줄였다.
  • VLVC는 저지연 및 랜덤 액세스 구성 포함 모든 상호 예측 모드에서 경쟁적인 비율-왜곡 성능를 달성했다.
  • 주관적 평가 결과, 동일한 비트레이트에서 VLVC로 복원된 프레임은 VVC로 복원된 프레임보다 더 선명하고 텍스처가 풍부한 것으로 나타났다.
  • 다양한 비디오 콘텐츠와 코딩 구성에서 높은 성능를 유지하며, 뛰어난 일반화 능력과 유연성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.