Skip to main content
QUICK REVIEW

[논문 리뷰] Region-of-Interest Based Neural Video Compression

Yura Perugachi-Diaz, Guillaume Sautière|arXiv (Cornell University)|2022. 03. 03.
Image and Signal Denoising Methods인용 수 4
한 줄 요약

이 논문은 영역별 관심 영역(ROI) 품질을 우선시하기 위해 ROI 마스크를 활용해 비트를 적응적으로 할당하는 두 가지 새로운 신경망 영상 압축 프레임워크를 제안한다. 암묵적 모델은 학습 중 배경 왜곡을 감소시켜 처리하는 반면, 명시적 잠재 스케일링 모델은 학습된 게인 텐서를 사용해 공간적 영역별로 양자화 간격을 제어한다. 두 방법 모두 학습 시 픽셀 수준의 ROI 애너테이션을 필요로 하지 않으면서도 DAVIS 데이터셋에서 기존 베이스라인을 능가하는 유의미한 비트율-왜곡 성능 향상을 달성하며, 다양한 데이터셋으로 일반화된다.

ABSTRACT

Humans do not perceive all parts of a scene with the same resolution, but rather focus on few regions of interest (ROIs). Traditional Object-Based codecs take advantage of this biological intuition, and are capable of non-uniform allocation of bits in favor of salient regions, at the expense of increased distortion the remaining areas: such a strategy allows a boost in perceptual quality under low rate constraints. Recently, several neural codecs have been introduced for video compression, yet they operate uniformly over all spatial locations, lacking the capability of ROI-based processing. In this paper, we introduce two models for ROI-based neural video coding. First, we propose an implicit model that is fed with a binary ROI mask and it is trained by de-emphasizing the distortion of the background. Secondly, we design an explicit latent scaling method, that allows control over the quantization binwidth for different spatial regions of latent variables, conditioned on the ROI mask. By extensive experiments, we show that our methods outperform all our baselines in terms of Rate-Distortion (R-D) performance in the ROI. Moreover, they can generalize to different datasets and to any arbitrary ROI at inference time. Finally, they do not require expensive pixel-level annotations during training, as synthetic ROI masks can be used with little to no degradation in performance. To the best of our knowledge, our proposals are the first solutions that integrate ROI-based capabilities into neural video compression models.

연구 동기 및 목표

  • 신경망 영상 코덱에서 균일한 비트 할당 방식의 한계를 해결하기 위해 인간의 시각 중심부(fovea)와 같은 시각적으로 중요한 영역을 우선시하지 못하는 문제를 해결한다.
  • 학습 과정에 ROI 인식을 통합함으로써 신경망 영상 압축에서 비균일한 비트율-왜곡 최적화를 가능하게 한다.
  • 학습 시 실제 픽셀 수준의 애너테이션을 필요로 하지 않으면서도 다양한 데이터셋과 ROI 사양에 일반화되는 모델을 설계한다.
  • 기존 신경망 및 전통적 코덱 대비 뛰어난 ROI 특화 비트율-왜곡 성능을 달성하면서도 계산 효율성을 유지한다.

제안 방법

  • 암묵적 ROI 모델은 배경 영역의 영향을 줄이기 위해 배경 페널티 하이퍼파라미터 γ를 활용해 수정된 왜곡 손실 함수로 학습된다.
  • 명시적 잠재 스케일링 모델은 ROI 마스크에서 유도된 보조 오토인코더를 통해 생성된 게인 텐서를 도입하여, 공간적 영역별로 잠재 특징의 양자화 간격을 조절한다.
  • 게인 텐서는 스칼라 양자화에서의 이산 마스크와 유사한 연속적이고 학습 가능한 등가물로 작용하여, 양자화 해상도에 대한 세밀한 제어를 가능하게 한다.
  • 두 모델 모두 스케일 스페이스 플로우(SSF) 아키텍처를 기반으로 하며, 하이퍼프리어 기반 영상 압축 프레임워크와 호환된다.
  • 기울기 추정을 위해 직선 통과(straight-through) 기법과 추가된 균일한 노이즈를 사용해 미분 가능한 양자화를 구현함으로써 엔드 투 엔드 학습이 가능하다.
  • 학습 시 합성 ROI 마스크를 사용함으로써 성능 저하가 최소화되어 애너테이션 없는 학습이 가능하다.

실험 결과

연구 질문

  • RQ1학습 과정에서 ROI를 우선시하도록 학습함으로써 신경망 영상 코덱이 ROI 영역에서 기존의 비트율-왜곡 성능을 뛰어넘을 수 있는가?
  • RQ2ROI 마스크에 대한 비용이 많이 드는 픽셀 수준의 애너테이션을 요구하지 않고도 ROI 기반 압축을 신경망 영상 코덱에 통합할 수 있는가?
  • RQ3제안된 모델은 재학습 없이도 추론 시 다양한 데이터셋과 ROI 사양에 일반화될 수 있는가?
  • RQ4기존 기준 대비 ROI 인식 압축을 도입할 경우 신경망 영상 코덱의 계산 비용은 얼마나 증가하는가?
  • RQ5암묵적 손실 기반 감소 방식에 비해 명시적 잠재 스케일링 메커니즘은 ROI 품질과 비트율-왜곡 트레이드오프 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 암묵적 및 명시적 ROI 기반 모델은 DAVIS 데이터셋에서 69.3%의 BD-rate 향상을 기록하며, ROI-PSNR 측면에서 기존 베이스라인을 크게 능가한다.
  • 모델은 학습 시 합성 ROI 마스크를 사용함에도 불구하고 추론 시 다양한 데이터셋과 ROI 사양에 잘 일반화된다.
  • 합성 ROI 마스크를 사용한 학습은 실제 마스크를 사용한 학습과 유사한 시각적 및 정량적 성능을 보이며, 약화된 감독 하에 성능 저하가 최소임을 확인한다.
  • 잠재 스케일링 모델의 런타임 오버헤드는 중간 수준이며, 720p 입력에서 I-프레임 인코딩 FPS가 기준 SSF 대비 17% 감소하고 디코딩 FPS는 24% 감소한다.
  • 명시적 잠재 스케일링 모델은 암묵적 모델보다 더 높은 양자화 해상도 제어 능력을 제공하며, 특히 저비트레이트에서 더 높은 ROI 품질을 달성한다.
  • 두 모델 모두 ROI 영역에서 높은 시각적 품질을 유지하면서 배경을 더 많이 왜곡시키며, 인간 시각 시스템의 특성과 부합한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.