Skip to main content
QUICK REVIEW

[논문 리뷰] Advances In Video Compression System Using Deep Neural Network: A Review And Case Studies

Dandan Ding, Zhan Ma|arXiv (Cornell University)|2021. 01. 15.
Advanced Data Compression Techniques인용 수 10
한 줄 요약

이 논문은 영상 압축 분야에서 딥 뉴럴 네트워크(DNN) 기반의 발전을 검토하며, 사전 처리, 코딩, 후처리의 세 가지 功能 블록에 중점을 둡니다. DNN을 활용한 솔루션—예를 들어 의미 인식 기반 사전 처리, 엔드 투 엔드 신경망 영상 코딩, 적응형 필터—를 제안하여 비율-왜곡 효율성과 주관적 품질 향상을 입증하였으며, 압축 성능 향상과 압축 영상의 기계 가독성 향상에 기여하는 사례 연구를 제시합니다.

ABSTRACT

Significant advances in video compression system have been made in the past several decades to satisfy the nearly exponential growth of Internet-scale video traffic. From the application perspective, we have identified three major functional blocks including pre-processing, coding, and post-processing, that have been continuously investigated to maximize the end-user quality of experience (QoE) under a limited bit rate budget. Recently, artificial intelligence (AI) powered techniques have shown great potential to further increase the efficiency of the aforementioned functional blocks, both individually and jointly. In this article, we review extensively recent technical advances in video compression system, with an emphasis on deep neural network (DNN)-based approaches; and then present three comprehensive case studies. On pre-processing, we show a switchable texture-based video coding example that leverages DNN-based scene understanding to extract semantic areas for the improvement of subsequent video coder. On coding, we present an end-to-end neural video coding framework that takes advantage of the stacked DNNs to efficiently and compactly code input raw videos via fully data-driven learning. On post-processing, we demonstrate two neural adaptive filters to respectively facilitate the in-loop and post filtering for the enhancement of compressed frames. Finally, a companion website hosting the contents developed in this work can be accessed publicly at https://purdueviper.github.io/dnn-coding/.

연구 동기 및 목표

  • 영상 트래픽의 기하급수적 증가와 더 높은 해상도/정밀도 요구사항으로 인한 효율적 영상 압축 수요 증가에 대응하기 위해.
  • 딥 뉴럴 네트워크(DNN)가 영상 압축의 세 핵심 기능 블록인 사전 처리, 코딩, 후처리를 어떻게 향상시킬 수 있는지 탐색하기 위해.
  • 인공지능 기반의 콘텐츠 적응형 압축을 통해 제한된 비트레이트 조건에서도 종단 간 영상 품질 경험(QoE)을 향상시키기 위해.
  • 압축 도메인에서 의미 특징을 유지시킴으로써 압축과 후속 컴퓨터 비전 작업의 공동 최적화를 가능하게 하기 위해.
  • 모델 복잡성, 제한된 데이터 하에서의 일반화 능력 부족, HVS(인간 시각 시스템) 기반의 품질 측정 지표 부족과 같은 핵심 과제를 규명하고 해결하기 위해.

제안 방법

  • 장면 이해를 위한 DNN 기반의 스위치 가능한 텍스처 기반 영상 코딩 프레임워크를 제안하여 의미 영역을 추출하고 적응형 양자화를 구현합니다.
  • 수동으로 설계된 코딩 도구 없이 원시 영상의 압축된 데이터 기반 표현을 학습하기 위해 스택된 DNN을 사용하는 엔드 투 엔드 신경망 영상 코딩 아키텍처를 도입합니다.
  • 내부 루프 및 후처리 단계를 위한 두 가지 신경망 기반 적응형 필터를 개발하여 압축 잔상 감소 및 재구성 프레임 품질 향상에 기여합니다.
  • 인간 시각 시스템(HVS)의 특성—예를 들어 마스킹 효과 및 주파수 선택성—을 활용하여 콘텐츠 인식 기반 인코딩을 가능하게 합니다.
  • SSIM, VMAF, 의미 특징 기반 손실 함수를 포함한 인지적으로 최적화된 손실 함수를 학습시켜 품질 평가를 향상시키기 위해 딥 러닝을 활용합니다.
  • 영상 코딩 파이프라인에 DNN 기반 기법을 통합하여 기계 시각 작업에 유용한 공간-시간 특징을 유지함으로써 완전한 복원 없이도 압축을 가능하게 합니다.

실험 결과

연구 질문

  • RQ1DNN 기반 사전 처리는 의미 콘텐츠 이해를 활용하여 영상 압축 효율을 어떻게 향상시킬 수 있는가?
  • RQ2엔드 투 엔드 신경망 영상 코딩은 전통적 코덱(예: VVC) 대비 비율-왜곡 성능에서 얼마나 뛰어나며, 주관적 품질을 유지할 수 있는가?
  • RQ3DNN 기반 적응형 필터가 후처리 및 내부 루프 단계에서 압축 잔상 감소 및 재구성 영상 품질 향상에 효과적으로 기여할 수 있는가?
  • RQ4DNN 기반 영상 압축은 어떻게 압축 도메인에서 인간의 시각 인지와 기계 지능 작업을 동시에 지원하도록 최적화될 수 있는가?
  • RQ5DNN 기반 영상 압축을 구현할 때의 핵심 과제는 무엇이며, 모델 설계와 하드웨어 가속화를 통해 어떻게 완화될 수 있는가?

주요 결과

  • 장면 이해 기반 DNN 기반 사전 처리를 통해 콘텐츠 적응형 인코딩이 가능해져, 주관적으로 중요한 영역에 더 높은 비트레이트를 할당함으로써 품질 향상이 가능합니다.
  • 스택된 DNN를 사용하는 엔드 투 엔드 신경망 영상 코딩은 전통적 코덱(VVC 등)과 비교해도 경쟁력 있거나 뛰어난 비율-왜곡 성능을 달성하며, 완전히 데이터 기반의 특징 학습이 가능합니다.
  • 후처리 및 내부 루프 단계에서 사용하는 신경망 기반 적응형 필터는 블록성 및 리버버브 잔상 감소에 크게 기여하여 주관적 및 객관적 영상 품질 지표가 향상됩니다.
  • DNN 기반 압축은 후속 컴퓨터 비전 작업에 유용한 의미 특징을 유지하므로, 전체 픽셀 복원 없이도 분류 및 검색 정확도 향상이 가능합니다.
  • 높은 계산 및 메모리 요구량에도 불구하고, NPU와 같은 전용 하드웨어를 통해 이동 및 엣지 디바이스에서 DNN 기반 영상 코덱의 확장 가능한 구현이 가능합니다.
  • HVS 인식 기반, 미분 가능한 품질 측정 지표(VMAF 등)를 DNN 학습에 통합하면 주관적 품질 향상이 가능하지만, 통합된 HVS 기반 지표는 아직 해결되지 않은 과제로 남아 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.