Skip to main content
QUICK REVIEW

[논문 리뷰] CVEGAN: A Perceptually-inspired GAN for Compressed Video Enhancement

Di Ma, Fan Zhang|arXiv (Cornell University)|2020. 11. 18.
Advanced Image Processing Techniques참고 문헌 94인용 수 8
한 줄 요약

CVEGAN은 압축 동영상 향상용 새로운 GAN 아키텍처를 제안하며, 다중 수준 잔차 블록(Mul 2 Res), 향상된 잔차 비국소 블록(ERNB), 향상된 CBAM(EBAM), 그리고 상대적 구면 GAN(ReSphereGAN) 학습 전략과 데이터 기반의 인지적 손실을 통합한다. 이는 HEVC HM16.20 대비 후처리 및 공간 해상도 적응에서 각각 최대 28% 및 38%의 코딩 이득을 기록하며, 잡음 요소를 줄이고 질감 세부 정보를 향상시켜 인지적 품질을 크게 향상시킨다.

ABSTRACT

We propose a new Generative Adversarial Network for Compressed Video quality Enhancement (CVEGAN). The CVEGAN generator benefits from the use of a novel Mul2Res block (with multiple levels of residual learning branches), an enhanced residual non-local block (ERNB) and an enhanced convolutional block attention module (ECBAM). The ERNB has also been employed in the discriminator to improve the representational capability. The training strategy has also been re-designed specifically for video compression applications, to employ a relativistic sphere GAN (ReSphereGAN) training methodology together with new perceptual loss functions. The proposed network has been fully evaluated in the context of two typical video compression enhancement tools: post-processing (PP) and spatial resolution adaptation (SRA). CVEGAN has been fully integrated into the MPEG HEVC video coding test model (HM16.20) and experimental results demonstrate significant coding gains (up to 28% for PP and 38% for SRA compared to the anchor) over existing state-of-the-art architectures for both coding tools across multiple datasets.

연구 동기 및 목표

  • 기존의 압축 동영상 향상 방법이 단순한 손실 함수와 얕은 네트워크에 의존하는 한계를 해결하기 위해.
  • 고급 딥러닝 아키텍처와 인지적으로 일치하는 학습을 활용하여 동영상 압축에서 인지적 품질을 향상시키기 위해.
  • 최소한의 비트레이트 오버헤드로 HEVC에서 후처리 및 공간 해상도 적응 모두를 향상시키는 GAN 기반 프레임워크를 개발하기 위해.
  • GAN 학습을 안정화하고 인간 시각 인지와 더 잘 일치하는 학습 전략을 설계하기 위해.
  • 다양한 데이터셋과 실제 동영상 코딩 시나리오에서 제안된 방법을 검증하기 위해.

제안 방법

  • 다중 분기와 다양한 커널 크기를 갖춘 다중 수준 잔차 학습 아키텍처인 Mul 2 Res 블록을 도입하여 특징 표현 능력과 네트워크 카디널리티를 향상시킨다.
  • 생성자와 판별자 양쪽에서 장거리 의존성을 캡처하고 특징 모델링을 향상시키기 위해 향상된 잔차 비국소 블록(ERNB)을 활용한다.
  • 중요한 공간적 및 채널적 특징에 동적으로 집중하기 위해 향상된 컨volutional 블록 주의 모듈(ECBAM)을 통합한다.
  • 초구면 상의 기하학적 거리(geodesic distances)를 사용하여 학습을 안정화하고 생성 샘플과의 일치도를 향상시키는 상대적 구면 GAN(ReSphereGAN) 학습 방법을 채택한다.
  • 로그arithm 형태의 네 가지 손실 성분을 조합한 새로운 인지적 손실 함수를 제안하며, 이는 8개의 주관적 동영상 품질 데이터베이스에서 수집된 데이터를 이용해 최적화된 가중치를 갖는다.
  • 엔드 투 엔드 평가를 위해 HEVC HM16.20 테스트 모델에 CVEGAN을 통합하여 후처리 및 공간 해상도 적응 시나리오 모두에서 평가한다.

실험 결과

연구 질문

  • RQ1변동하는 커널 크기를 갖는 다중 수준 잔차 블록은 표준 잔차 블록에 비해 동영상 향상 성능을 향상시키는가?
  • RQ2향상된 주의 메커니즘과 비국소 기법(ERNB, ECBAM)이 압축 동영상 향상에서 인지적 품질을 얼마나 향상시키는가?
  • RQ3ReSphereGAN 학습 전략은 기존 GAN에 비해 동영상 향상에서 더 안정적인 학습과 더 나은 인지적 결과를 이끌어내는가?
  • RQ4제안된 데이터 기반 인지적 손실 함수는 모델 출력을 인간 시각 품질 평가와 얼마나 잘 일치시키는가?
  • RQ5동일한 비트레이트 조건에서 후처리 및 공간 해상도 적응 모두에서 CVEGAN은 최신 기술 대비 얼마나 높은 코딩 이득을 기록하는가?

주요 결과

  • CVEGAN은 다양한 데이터셋에서 HEVC HM16.20 앵커 대비 후처리 작업에서 최대 28%의 코딩 이득을 기록한다.
  • 공간 해상도 적응의 경우, CVEGAN은 기준선 대비 최대 38%의 코딩 이득을 제공하여 뛰어난 성능을 입증한다.
  • 주관적 평가 결과, CVEGAN 출력은 HEVC, RNAN, MSRGAN 대비 차단 잡음이 적고 질감 세부 정보가 풍부하며 대비가 높은 것으로 확인되었다.
  • 제안된 ReSphereGAN 학습 방법은 학습을 안정화시키며, 초구면 공간에서 생성된 특징와 목표 특징 간의 격차를 감소시켰다.
  • 실제 주관적 데이터를 이용해 최적화된 인지적 손실 함수는 인간 시각 품질 평가와 강한 상관관계를 보였다.
  • 그림 1, 10–13의 시각적 비교에서 CVEGAN은 PP 및 SRA 시나리오 모두에서 최신 기술 대비 뛰어난 성능을 지속적으로 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.