[논문 리뷰] Neural Video Coding using Multiscale Motion Compensation and Spatiotemporal Context Model
이 논문은 다중 척도 운동 보정을 위한 피라미드 디코더와 새로운 다중 척도 운동 보정 네트워크(MS-MCN)를 활용하고, 적응형 시공간적 맥락 모델링 및 비국소 주의 메커니즘을 통합한 엔드 투 엔드 신경망 영상 코딩 프레임워크(NVC)를 제안한다. 이 프레임워크는 다양한 영상 시퀀스에서 H.265/HEVC 및 기타 학습 기반 영상 코더보다 일관된 성능 향상을 보이며, PSNR 기준 평균 BD-비트율 절감률은 -50.83%, MS-SSIM 기준은 -46.52%를 기록한다.
Over the past two decades, traditional block-based video coding has made remarkable progress and spawned a series of well-known standards such as MPEG-4, H.264/AVC and H.265/HEVC. On the other hand, deep neural networks (DNNs) have shown their powerful capacity for visual content understanding, feature extraction and compact representation. Some previous works have explored the learnt video coding algorithms in an end-to-end manner, which show the great potential compared with traditional methods. In this paper, we propose an end-to-end deep neural video coding framework (NVC), which uses variational autoencoders (VAEs) with joint spatial and temporal prior aggregation (PA) to exploit the correlations in intra-frame pixels, inter-frame motions and inter-frame compensation residuals, respectively. Novel features of NVC include: 1) To estimate and compensate motion over a large range of magnitudes, we propose an unsupervised multiscale motion compensation network (MS-MCN) together with a pyramid decoder in the VAE for coding motion features that generates multiscale flow fields, 2) we design a novel adaptive spatiotemporal context model for efficient entropy coding for motion information, 3) we adopt nonlocal attention modules (NLAM) at the bottlenecks of the VAEs for implicit adaptive feature extraction and activation, leveraging its high transformation capacity and unequal weighting with joint global and local information, and 4) we introduce multi-module optimization and a multi-frame training strategy to minimize the temporal error propagation among P-frames. NVC is evaluated for the low-delay causal settings and compared with H.265/HEVC, H.264/AVC and the other learnt video compression methods following the common test conditions, demonstrating consistent gains across all popular test sequences for both PSNR and MS-SSIM distortion metrics.
연구 동기 및 목표
- 모든 영상 코딩 기술의 핸드크래프트 도구에 의존하고 모어의 법칙에 따른 수익 감소 추세에 제약을 받는 전통적인 블록 기반 영상 코딩의 한계를 해결하기 위해 엔드 투 엔드 딥 러닝 기반 영상 코딩 프레임워크를 개발한다.
- 다중 척도 운동 보정 네트워크(MS-MCN)와 피라미드 디코더를 도입하여 다중 척도 광학 유속을 생성함으로써 대규모 운동 벡터에 대한 예측 정확도와 강인성을 향상시킨다.
- VAE 블로킹에서 유도된 공간적, 시간적, 하이퍼프리오르 정보를 통합한 적응형 맥락 모델을 활용해 운동 정보의 시공간 상관관계를 모델링함으로써 엔트로피 코딩 효율을 향상시킨다.
- 다중 연속 P-프레임에 걸쳐 복원 손실을 최소화하는 다중 프레임 학습 전략을 도입하여 예측 코딩에서의 시간적 오류 전파를 완화한다.
- 내부, 운동, 잔여 정보 코딩 모듈을 종합 최적화하여 기존의 학습 기반 영상 코더 및 H.265/HEVC와 같은 표준 코덱보다 뛰어난 비트율-왜곡 성능을 달성한다.
제안 방법
- NVC 프레임워크는 신경-내부, 신경-운동, 신경-잔여 정보를 엔드 투 엔드 방식으로 압축하기 위해 세 개의 별도된 변동형 오토인코더(VAEs)를 사용한다.
- 다중 척도 운동 보정 네트워크(MS-MCN)는 여러 척도에서 운동을 추정하고 보정하여 다중 척도 유속장을 생성함으로써 대규모 운동 벡터에 대한 예측 정확도를 향상시킨다.
- 신경-운동 VAE 내의 피라미드 디코더는 운동 특징의 계층적 표현을 가능하게 하여 효율적인 다중 척도 유속 추정 및 복원을 지원한다.
- 적응형 시공간 맥락 모델은 공간적 맥락, 이전 프레임의 시간적 맥락, VAE 블로킹에서 유도된 하이퍼프리오르를 함께 모델링하여 엔트로피 코딩 효율을 향상시킨다.
- 비국소 주의 모듈(NLAM)은 VAE 블로킹에 통합되어 전역 및 국소 수신 필드를 갖는 적응형 특징을 암묵적으로 추출함으로써 표현 능력을 향상시킨다.
- 다중 모듈 최적화 및 다중 프레임 학습 전략을 도입하여 다중 연속 P-프레임에 걸친 복원 손실을 공동 최적화함으로써 시간적 오류 전파를 최소화한다.
실험 결과
연구 질문
- RQ1딥 러닝 기반 영상 코딩 프레임워크가 H.265/HEVC와 같은 전통적인 블록 기반 코덱보다 비트율-왜곡 효율에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2피라미드 디코더를 활용한 다중 척도 운동 보정이 대규모 운동 벡터에 대해 운동 추정 및 예측 정확도를 뚜렷이 향상시키는가?
- RQ3적응형 시공간 맥락 모델이 공간 맥락과 하이퍼프리오르를 초월해 운동 정보의 엔트로피 코딩 효율을 향상시킬 수 있는가?
- RQ4다중 프레임 학습 전략이 예측 영상 코딩에서 시간적 오류 전파를 어느 정도 감소시키고 안정성을 향상시키는가?
- RQ5VAE 블로킹에 비국소 주의 모듈을 통합할 경우 영상 특징의 표현 품질과 압축 효율에 어떤 영향을 미치는가?
주요 결과
- NVC는 H.265/HEVC 대비 모든 테스트 시퀀스에서 평균 BD-비트율 절감률을 PSNR 기준 -50.83%, MS-SSIM 기준 -46.52%로 기록하여 일관된 우수성을 입증한다.
- 제안된 MS-MCN와 피라미드 디코더는 연속적인 노이즈 제거 네트워크를 사용하는 단일 척도 운동 보정보다 우수하며, 다양한 비트레이트 범위에서 평균 0.2–0.3 dB의 PSNR 향상을 달성한다.
- 다중 프레임 학습은 시간적 안정성과 성능 일관성을 크게 향상시켜 단일 프레임 학습 대비 GOP 내에서의 품질 저하를 감소시킨다.
- 고운동 콘텐츠에서는 운동 정보의 압축이 시간적 프리오르에 의해 가장 크게 기여하며, HEVC Class E 데이터셋에서 최대 58.63%의 비트 절감이 가능하다.
- 적응형 시공간 맥락 모델은 공간, 시간, 하이퍼프리오르 간의 상관관계를 효율적으로 모델링하여 고운동 영상에서 특히 운동 비트레이트를 줄이는 데 기여한다.
- 비국소 주의 모듈의 도입은 장거리 의존성을 포착함으로써 표현 능력을 향상시키고, 복원 품질 및 압축 효율을 향상시키는 데 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.