Skip to main content
QUICK REVIEW

[논문 리뷰] Perceptual Learned Video Compression with Recurrent Conditional GAN

Ren Yang, Radu Timofte|arXiv (Cornell University)|2021. 09. 07.
Advanced Image Processing Techniques인용 수 5
한 줄 요약

이 논문은 낮은 비트레이트에서 사진처럼 사실적인 비디오와 시간적으로 일관된 결과를 얻기 위해 순환 조건부 GAN을 사용하는 인지적 학습된 비디오 압축(PLVC) 프레임워크를 제안한다. 이는 공간적, 시간적, 은닉 상태 특징에 조건이 붙은 판별자와 함께 순환 오토인코더 생성자에 대해 적대적 학습을 수행한다. 제안된 방법은 여러 지표와 사용자 연구를 통해 HEVC(HM 16.20) 및 기존의 학습된 비디오 압축 모델보다 인지적 품질에서 뛰어난 성능을 보였다.

ABSTRACT

This paper proposes a Perceptual Learned Video Compression (PLVC) approach with recurrent conditional GAN. We employ the recurrent auto-encoder-based compression network as the generator, and most importantly, we propose a recurrent conditional discriminator, which judges on raw vs. compressed video conditioned on both spatial and temporal features, including the latent representation, temporal motion and hidden states in recurrent cells. This way, the adversarial training pushes the generated video to be not only spatially photo-realistic but also temporally consistent with the groundtruth and coherent among video frames. The experimental results show that the learned PLVC model compresses video with good perceptual quality at low bit-rate, and that it outperforms the official HEVC test model (HM 16.20) and the existing learned video compression approaches for several perceptual quality metrics and user studies. The codes will be released at the project page: https://github.com/RenYang-home/PLVC.

연구 동기 및 목표

  • 기존의 왜곡 최적화 방법에 비해 인지적 비디오 압축의 격차를 메우기 위해 시각적 품질을 향상시키는 것.
  • 압축된 프레임에서 사진처럼 사실적인 질감과 시간적 일관성을 유지하는 비디오 압축 모델을 개발하는 것.
  • 종단 간 비디오 압축을 위한 순환적이고 조건부 판별자를 활용한 적대적 학습의 효과성을 탐색하는 것.
  • 객관적 지표와 사용자 연구를 통한 인지적 성능 평가를 통해 HEVC 및 이전의 학습된 방법보다 뛰어난 성능을 입증하는 것.

제안 방법

  • 시간 기억을 은닉 상태를 통해 구현하는 순환 오토인코더 기반 생성자를 사용하여 비디오 프레임을 압축하고 재구성한다.
  • 잠재 표현, 운동 특징 및 순환 은닉 상태에 조건이 붙은 순환 조건부 판별자를 도입하여 원본 대 비압축 비디오를 평가한다.
  • 공간적 및 시간적 맥락을 활용하여 비트레이트, 왜곡, 인지적 품질을 균형 잡는 다중 조건부 적대적 손실을 설계한다.
  • 오류 전파를 제한하고 장기적인 시간적 모델링을 지원하기 위해 I-프레임을 9프레임 간격으로 배치하는 이중 IP-PPP GOP 구조를 사용한다.
  • DVC와 같은 다른 백본에 대해서도 제안된 판별자와 GAN 손실을 적용하여 주된 PLVC 아키텍처를 초월한 일반화 능력을 입증한다.
  • 생성자는 인지적 손실을 최소화하고 판별자는 실제 비디오와 재구성된 비디오를 구분하도록 종단 간 적대적 최적화를 통해 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1순환 조건부 GAN은 낮은 비트레이트 효율을 유지하면서도 학습된 비디오 압축에서 인지적 품질을 향상시킬 수 있는가?
  • RQ2은닉 상태와 운동 특징에 조건이 붙은 판별자의 효과는 압축된 비디오의 시간적 일관성을 향상시키는 데 얼마나 기여하는가?
  • RQ3제안된 적대적 학습 프레임워크는 HEVC(HM 16.20)와 같은 왜곡 최적화 모델보다 인지적 품질 지표와 사용자 인식에서 뛰어나게 성능을 발휘하는가?
  • RQ4제안된 판별자는 어떤 정도로 다양한 비디오 압축 아키텍처에 일반화되는가?
  • RQ5판별자에서 공간적, 시간적 또는 은닉 상태 조건을 제거할 경우 인지적 품질과 아티팩트 생성에 어떤 영향을 미치는가?

주요 결과

  • 시각적 비교를 통해 PLVC 모델은 HEVC(0.0813 bpp)보다 낮은 비트레이트(0.0730 bpp)를 기록하면서도 훨씬 더 사실적인 질감을 생성함을 확인했다.
  • 사용자 연구(MOS) 결과, PLVC는 낮은 비트레이트에서 HEVC 및 기존의 학습된 비디오 압축 방법보다 인지적 품질에서 뛰어난 성능을 보였다.
  • LPIPS, FID, KID 지표는 PLVC가 HM 16.20 및 기준 학습 모델보다 우수한 인지적 품질을 달성했음을 확인했다.
  • 제거 실험 결과, 판별자에서 시간적 조건(은닉 상태 및 운동 특징)을 제거할 경우 시간적 일관성과 인지적 품질이 떨어지며, MOS 값이 왜곡 최적화 모델의 수준 이하로 떨어졌다.
  • 제안된 순환 조건부 판별자는 효과적으로 일반화된다: DVC에 적용했을 때도 FID, KID 지표가 향상되었고, HM 16.20를 초월하는 성능을 보였다. 이는 그 적용 범위가 넓다는 것을 증명한다.
  • GOP 내의 P-프레임에서 명백한 오류 전파가 관찰되지 않았으며, 이는 이중 IP-PPP 구조와 순환 기억이 시간적 사전 지식을 유지하기 때문으로 분석된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.