Skip to main content
QUICK REVIEW

[논문 리뷰] Learning a Virtual Codec Based on Deep Convolutional Neural Network to Compress Image

Lijun Zhao, Huihui Bai|arXiv (Cornell University)|2017. 12. 16.
Advanced Data Compression Techniques참고 문헌 7인용 수 7
한 줄 요약

이 논문은 표준 코덱(예: JPEG)을 특징 기술 네트워크와 후처리 네트워크와 통합한 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 학습 가능한 가상 코덱을 통해 비가역적 양자화 단계를 거쳐 기울기 역전파를 가능하게 하여, 매우 낮은 비트레이트에서 최신 기술 수준의 성능을 달성한다. 이는 압축 잔상의 현저한 감소와 기존 코덱과의 호환성 유지로 이어진다.

ABSTRACT

Although deep convolutional neural network has been proved to efficiently eliminate coding artifacts caused by the coarse quantization of traditional codec, it's difficult to train any neural network in front of the encoder for gradient's back-propagation. In this paper, we propose an end-to-end image compression framework based on convolutional neural network to resolve the problem of non-differentiability of the quantization function in the standard codec. First, the feature description neural network is used to get a valid description in the low-dimension space with respect to the ground-truth image so that the amount of image data is greatly reduced for storage or transmission. After image's valid description, standard image codec such as JPEG is leveraged to further compress image, which leads to image's great distortion and compression artifacts, especially blocking artifacts, detail missing, blurring, and ringing artifacts. Then, we use a post-processing neural network to remove these artifacts. Due to the challenge of directly learning a non-linear function for a standard codec based on convolutional neural network, we propose to learn a virtual codec neural network to approximate the projection from the valid description image to the post-processed compressed image, so that the gradient could be efficiently back-propagated from the post-processing neural network to the feature description neural network during training. Meanwhile, an advanced learning algorithm is proposed to train our deep neural networks for compression. Obviously, the priority of the proposed method is compatible with standard existing codecs and our learning strategy can be easily extended into these codecs based on convolutional neural network. Experimental results have demonstrated the advances of the proposed method as compared to several state-of-the-art approaches, especially at very low bit-rate.

연구 동기 및 목표

  • 표준 이미지 코덱에서 딥 뉴럴 네트워크를 통합할 때 발생하는 양자화의 비가역성 문제를 해결하기 위해.
  • 특징 기술 네트워크 → 표준 코덱 → 후처리 네트워크의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 저비트레이트에서 블록화, 흐림, 리버브 잔상 감소를 통해 이미지 복원 품질 향상시키기 위해.
  • JPEG와 같은 기존 표준 코덱과의 호환성을 유지하면서도 압축 효율성을 향상시키기 위해.
  • 비가역적 코덱 단계를 통해 효과적인 기울기 역전파를 가능하게 하는 학습 전략 개발하기 위해.

제안 방법

  • 특징 기술 신경망(FDNN)이 원본 이미지를 데이터 크기를 줄인 저차원 표현으로 압축한다.
  • 저차원 표현이 표준 코덱(예: JPEG)을 통과하여 통제된 왜곡과 잔상을 유도한다.
  • 후처리 신경망(ComCNN)이 블록화 및 흐림과 같은 압축 잔상을 제거하여 이미지를 복원한다.
  • 가상 코덱 신경망을 도입하여 특징 기술에서 압축된 이미지로의 매핑을 근사함으로써, 후처리기에서 FDNN으로의 기울기 흐름을 가능하게 한다.
  • 전체 문제를 세 개의 하위 문제(FDNN, 가상 코덱, ComCNN 학습)로 분해하는 공동 최적화 전략을 사용해 프레임워크를 학습한다.
  • 가상 코덱 네트워크는 표준 코덱의 서지레이트 역할을 하여, 비가역적 양자화 단계를 통한 기울기 역전파를 가능하게 한다.

실험 결과

연구 질문

  • RQ1비가역적 표준 코덱이 특징 인코더와 후처리기 사이에 존재할 때 딥 러닝 프레임워크를 엔드 투 엔드로 학습할 수 있는가?
  • RQ2딥 러닝 압축 파이프라인에서 표준 코덱의 양자화 단계를 효과적으로 기울기 역전파할 수 있는가?
  • RQ3학습된 가상 코덱이 매우 낮은 비트레이트에서 잔상 제거 및 복원 품질 향상에 얼마나 기여하는가?
  • RQ4특히 극한의 압축 조건에서, 제안된 방법이 PSNR 및 SSIM 측정치에서 최신 기술 수준의 접근법과 어떻게 비교되는가?
  • RQ5특징 표현(FDNN 출력)의 선택이 압축 잔상의 분포와 이후 복원 품질에 상당한 영향을 미치는가?

주요 결과

  • 제안된 방법은 비교된 모든 방법들 중에서 특히 매우 낮은 비트레이트(예: bpp ≤ 0.25)에서 가장 높은 PSNR 및 SSIM 점수를 기록한다.
  • 특히 털과 눈꺼풀 윤곽 등의 미세한 디테일을 유지하는 데 있어, Jiang et al. [35]보다 목적적 지표와 시각적 품질 모두에서 뚜렷한 우수성을 보인다.
  • 가상 코덱 네트워크는 후처리기에서 특징 기술 네트워크로의 효과적인 기울기 역전파를 가능하게 하여 최적의 학습에 핵심적인 역할을 한다.
  • 프레임워크는 JPEG와 같은 표준 코덱과 완전히 호환되며, 수정 없이 기존 압축 파이프라인에 통합 가능하다.
  • 시각적 비교 결과, 제안된 방법은 Foi [14], BM3D [22], DicTV [17], CONCOLOR [18]보다 블록화 및 흐림 잔상을 더 효과적으로 감소시킨다.
  • 제안된 방법과 Jiang et al. [35] 간의 잔상 분포 차이는 FDNN이 학습한 서로 다른 특징 표현에 기인하며, 이는 디코더에서의 더 나은 복원을 이끌어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.