Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Predictive Video Compression with Bi-directional Prediction

Woonsung Park, Munchurl Kim|arXiv (Cornell University)|2019. 04. 05.
Advanced Image Processing Techniques참고 문헌 3인용 수 6
한 줄 요약

이 논문은 양방향 예측 코딩과 광학 흐름 추정, 이중 예측 네트워크를 통합하여 운동 벡터 전송이 필요 없도록 하는 딥러닝 기반 영상 압축 프레임워크인 BP-DVC Net을 제안한다. 특징 맵 내에서 학습된 광학 흐름과 시간적 맥락을 활용함으로써, PSNR 및 MS-SSIM 기준으로 H.264 및 HEVC와 비교할 만한 압축 효율성을 달성하였으며, 광학 흐름 손실 및 예측 손실을 사용한 엔드 투 엔드 훈련을 수행하였다.

ABSTRACT

Recently, deep image compression has shown a big progress in terms of coding efficiency and image quality improvement. However, relatively less attention has been put on video compression using deep learning networks. In the paper, we first propose a deep learning based bi-predictive coding network, called BP-DVC Net, for video compression. Learned from the lesson of the conventional video coding, a B-frame coding structure is incorporated in our BP-DVC Net. While the bi-predictive coding in the conventional video codecs requires to transmit to decoder sides the motion vectors for block motion and the residues from prediction, our BP-DVC Net incorporates optical flow estimation networks in both encoder and decoder sides so as not to transmit the motion information to the decoder sides for coding efficiency improvement. Also, a bi-prediction network in the BP-DVC Net is proposed and used to precisely predict the current frame and to yield the resulting residues as small as possible. Furthermore, our BP-DVC Net allows for the compressive feature maps to be entropy-coded using the temporal context among the feature maps of adjacent frames. The BP-DVC Net has an end-to-end video compression architecture with newly designed flow and prediction losses. Experimental results show that the compression performance of our proposed method is comparable to those of H.264, HEVC in terms of PSNR and MS-SSIM.

연구 동기 및 목표

  • 이미지 압축에 비해 딥러닝 기반 영상 압축 분야에서의 진전이 부족한 문제를 해결하기 위해.
  • 기존 영상 코덱에서 운동 벡터와 잔차를 전송하는 데서 비효율적인 문제를 해결하기 위해.
  • 시간적 맥락과 광학 흐름을 활용하는 엔드 투 엔드 훈련 가능한 영상 압축 네트워크를 개발하기 위해.
  • 학습된 이중 예측 메커니즘을 통해 잔차 오차를 최소화하여 압축 효율을 향상시키기 위해.
  • 이웃 프레임 간의 시간적 의존성을 활용하여 압축 특징 맵의 엔트로피 압축을 가능하게 하기 위해.

제안 방법

  • 이중 예측 영상 압축을 위해 B-프레임 코딩 구조를 딥 네트워크에 통합하기 위해.
  • 엔코더와 디코더 양쪽에 광학 흐름 추정 네트워크를 구현하여 운동 벡터 전송을 제거하기 위해.
  • 앞서 예측된 프레임과 뒤로 예측된 프레임을 융합하여 정확한 프레임 재구성 결과를 도출하는 이중 예측 네트워크를 설계하기 위해.
  • 이웃 프레임의 학습된 특징 맵을 엔트로피 압축의 맥락으로 사용하여 압축 효율을 향상시키기 위해.
  • 재구성 품질 향상과 잔차 최소화를 최적화하기 위해 전용 광학 흐름 손실 및 예측 손실 함수를 사용하여 네트워크를 엔드 투 엔드로 훈련시키기 위해.
  • 이웃 프레임의 시간적 맥락을 활용하여 압축 특징 맵을 엔트로피 압축하여 비트레이트를 감소시키기 위해.

실험 결과

연구 질문

  • RQ1딥러닝 기반 영상 압축 프레임워크가 운동 벡터 전송 없이도 H.264 및 HEVC와 비교할 만한 압축 효율성을 달성할 수 있는가?
  • RQ2엔드 투 엔드 영상 압축에서 기존의 운동 벡터 신호 전송을 대체하기 위해 광학 흐름 추정이 얼마나 효과적인가?
  • RQ3학습된 융합을 통한 이중 예측이 잔차 압축 및 재구성 품질 향상에 어느 정도 기여하는가?
  • RQ4특징 맵 내의 시간적 맥락이 딥 뷰잉 압축에서 엔트로피 압축 성능 향상에 기여하는가?
  • RQ5광학 흐름 손실과 예측 손실을 함께 최적화함으로써 전체 압축 성능에 어떤 영향을 미치는가?

주요 결과

  • BP-DVC Net은 표준 영상 시퀀스 전반에서 H.264 및 HEVC와 비교할 만한 PSNR 및 MS-SSIM 성능을 달성하였다.
  • 학습된 광학 흐름을 통해 운동 벡터 전송을 제거함으로써 오버헤드를 감소시켜 압축 효율이 향상되었다.
  • 이중 예측 네트워크가 잔차 에너지를 크게 감소시켜 동일 품질에서 더 낮은 비트레이트를 달성하였다.
  • 이웃 특징 맵의 시간적 맥락을 활용한 엔트로피 압축이 압축 효율을 향상시켰다.
  • 광학 흐름 손실 및 예측 손실을 함께 최적화한 엔드 투 엔드 훈련을 통해 운동 추정과 재구성의 효과적인 공동 최적화가 가능했다.
  • 명시적인 운동 벡터 신호 전송 없이도 다양한 영상 콘텐츠에 대해 우수한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.