Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Video Compression Guided by Soft Edge Detection

Sung‐Soo Kim, Jin‐Soo Park|arXiv (Cornell University)|2018. 11. 26.
Advanced Image Processing Techniques참고 문헌 30인용 수 6
한 줄 요약

이 논문은 매우 낮은 비트레이트에서 높은 품질의 복원을 가능하게 하기 위해 키 프레임에서 저수준 특징 맵을 생성하는 소프트 에지 검출기를 사용하는 GAN 기반 비디오 압축 프레임워크를 제안한다. 소규모 키 프레임 세트와 그에 해당하는 소프트 에지 맵을 기반으로 조건부 GAN을 훈련시킴으로써, 10 Kbps 이하의 비트레이트에서 H.264 및 HEVC보다 뛰어난 인지적 품질을 달성한다. 특히 기존 표준 코덱이 실패하는 낮은 비트레이트 영역에서 두드러진 성능을 보인다.

ABSTRACT

We propose a video compression framework using conditional Generative Adversarial Networks (GANs). We rely on two encoders: one that deploys a standard video codec and another which generates low-level maps via a pipeline of down-sampling, a newly devised soft edge detector, and a novel lossless compression scheme. For decoding, we use a standard video decoder as well as a neural network based one, which is trained using a conditional GAN. Recent "deep" approaches to video compression require multiple videos to pre-train generative networks to conduct interpolation. In contrast to this prior work, our scheme trains a generative decoder on pairs of a very limited number of key frames taken from a single video and corresponding low-level maps. The trained decoder produces reconstructed frames relying on a guidance of low-level maps, without any interpolation. Experiments on a diverse set of 131 videos demonstrate that our proposed GAN-based compression engine achieves much higher quality reconstructions at very low bitrates than prevailing standard codecs such as H.264 or HEVC.

연구 동기 및 목표

  • 매우 낮은 비트레이트에서 H.264 및 HEVC와 같은 표준 비디오 코덱의 성능 한계를 해결하기 위해.
  • 비디오 압축에서 생성 모델의 사전 훈련을 위해 대규모 비디오 데이터셋에 의존하는 것을 줄이기 위해.
  • 조건부 GAN 아키텍처를 통해 의미적 에지 정보를 활용하여 낮은 비트레이트에서 복원 품질을 향상시키기 위해.
  • 소프트 에지 맵이 보간 없이도 신경망 기반 비디오 복원에 효과적인 가이드로 기능할 수 있는지 탐색하기 위해.
  • GAN 압축 비디오에서 목적적 비디오 품질 평가(VQA) 지표와 주관적 시각 품질 간의 격차를 평가하기 위해.

제안 방법

  • 프레임워크는 두 개의 인코더를 사용한다: 하나는 키 프레임의 표준 H.264 압축을 위한 것이고, 다른 하나는 다운샘플링 파이프라인을 거친 후 새로운 소프트 에지 검출기를 적용하여 저해상도 에지 맵을 생성한다.
  • 소프트 에지 검출기는 백프로파게이션을 통해 엔드 투 엔드 훈련이 가능한 미분 가능하고 연속적인 에지 표현을 생성하도록 설계되었다.
  • 조건부 GAN 기반 디코더는 키 프레임과 그에 해당하는 소프트 에지 맵 쌍을 기반으로 훈련되며, 인지적 현실감을 강제하기 위해 디스크림ิน레이터를 사용한다.
  • 디코더는 보간 없이 소프트 에지 맵과 키 프레임 정보로부터 전체 해상도 프레임을 복원한다.
  • 소프트 에지 맵에 대해 새로운 손실 없는 압축 기법을 적용하여 비트레이트를 추가로 감소시켰다.
  • 시스템은 단일 비디오에서 키 프레임으로서 프레임의 1%만 사용하여 훈련되었으며, 대규모 비디오 데이터셋이 필요로 하는 것을 방지했다.

실험 결과

연구 질문

  • RQ1소프트 에지 맵은 매우 낮은 비트레이트에서 신경망 기반 비디오 복원에 효과적이고 효율적인 가이드로 기능할 수 있는가?
  • RQ2단일 비디오에서 소수의 키 프레임만을 사용하여 훈련된 GAN 기반 디코더가 낮은 비트레이트 영역에서 H.264 및 HEVC와 같은 표준 코덱을 능가하는가?
  • RQ3왜 목적적 VQA 지표(예: PSNR, SSIM)는 H.264보다 낮게 평가되지만, 시각적 품질은 더 뛰어난 GAN 압축 비디오의 경우가 있는가?
  • RQ4보간에 의존하는 표준 DNN 기반 비디오 압축과 비교해 볼 때, 에지 기반 가이드가 복원 정밀도를 얼마나 향상시키는가?
  • RQ5경량이자 최적화되지 않은 네트워크조차도 낮은 비트레이트에서 뛰어난 인지적 품질을 달성할 수 있다면, 더 깊은 아키텍처로 향상 가능성이 있는가?

주요 결과

  • 우리의 GAN 기반 코덱은 10 Kbps 이하의 비트레이트에서 H.264 및 HEVC보다 뚜렷이 높은 인지적 비디오 품질을 달성했으며, H.264가 실패하는 7.14 Kbps에서도 실용적인 복원이 가능했다.
  • 7.5 Kbps 이하의 비트레이트에서 우리 모델은 인식 가능하고 세부 정보가 풍부한 프레임을 생성했고, H.264는 인식 불가능한 블록 아티팩트를 생성했다.
  • KTH 및 YouTube 포즈 데이터셋에서 131개 비디오 전반에 걸쳐 MS-SSIM, PSNR, SSIM, VMAF에서 우리 모델이 H.264를 앞섰다. 특히 3–30 Kbps 범위에서 두드러진 성능을 보였다.
  • 비록 뛰어난 시각적 품질을 제공했지만, 10 Kbps 이상의 비트레이트에서 목적적 VQA 점수(예: PSNR, SSIM)는 H.264보다 낮게 평가되었으며, 이는 목적적 지표와 인간의 시각 인식 간의 괴리가 있음을 시사한다.
  • 6.51 Kbps에서 우리 모델의 시각적 품질은 11.00 Kbps에서 H.264의 품질을 뛰어넘었으며, 목적적 지표에서는 H.264가 더 높게 평가되었기 때문에, 현재의 VQA 모델이 GAN 생성 콘텐츠에 대해 한계를 가진다는 것을 시사한다.
  • 이 프레임워크는 단지 한 비디오에서 1%의 프레임만을 키 프레임으로 사용함으로써, 매우 소규모의 훈련 데이터로도 에지 기반 가이드를 통해 고품질 복원을 가능하게 함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.