Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Image Compression via End-to-End Learning

Haojie Liu, Tong Chen|arXiv (Cornell University)|2018. 06. 01.
Advanced Image Processing Techniques인용 수 22
한 줄 요약

이 논문은 CNN 기반의 딥러닝 기반 이미지 압축 방법을 제안하며, 동일한 비트레이트에서 BPG, WebP, JPEG2000 및 JPEG보다 MS-SSIM에서 뛰어난 성능을 보인다. 비용-왜곡 최적화를 위한 새로운 쉬운 것에서 어려운 것으로의 전이 학습 전략과 함께 인지적 손실 및 적대적 손실을 결합함으로써, Kodak 및 ETH Zurich의 P/M 데이터셋에서 각각 7.81% 및 19.1%의 BD-레이트 감소를 달성한다.

ABSTRACT

We present a lossy image compression method based on deep convolutional neural networks (CNNs), which outperforms the existing BPG, WebP, JPEG2000 and JPEG as measured via multi-scale structural similarity (MS-SSIM), at the same bit rate. Currently, most of the CNNs based approaches train the network using a L2 loss between the reconstructions and the ground-truths in the pixel domain, which leads to over-smoothing results and visual quality degradation especially at a very low bit rate. Therefore, we improve the subjective quality with the combination of a perception loss and an adversarial loss additionally. To achieve better rate-distortion optimization (RDO), we also introduce an easy-to-hard transfer learning when adding quantization error and rate constraint. Finally, we evaluate our method on public Kodak and the Test Dataset P/M released by the Computer Vision Lab of ETH Zurich, resulting in averaged 7.81% and 19.1% BD-rate reduction over BPG, respectively.

연구 동기 및 목표

  • 단일 L2 픽셀 단위 재구성 손실을 사용하는 CNN 기반 이미지 압축 방법에서 흔히 발생하는 시각적 품질 저하 및 과도한 부드러움 문제를 해결하기 위해.
  • 학습 목표에 인지적 손실 및 적대적 손실을 통합하여 저비트레이트에서 주관적 이미지 품질을 향상시키기 위해.
  • 양자화 및 비트레이트 제약 조건을 점진적으로 도입하는 새로운 쉬운 것에서 어려운 것으로의 전이 학습 전략을 통해 비용-왜곡 최적화(RDO)를 향상시키기 위해.
  • 표준 벤치마크 데이터셋에서 MS-SSIM 및 BD-레이트 감소 측정 기준으로 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이 방법은 엔드 투 엔드 이미지 압축을 위한 깊은 합성곱 신경망(CNN)을 사용하여 이미지 특징과 양자화의 공동 표현을 학습한다.
  • 인지 손실은 고수준의 의미적 및 구조적 콘텐츠를 유지함으로써 과도한 부드러움을 줄이고 시각적 품질을 향상시킨다.
  • 적대적 손실은 판별기 모델을 통해 진짜 이미지와 재구성된 이미지를 구분하도록 훈련시켜 질감의 현실감과 인지적 정밀도를 향상시킨다.
  • 쉬운 것에서 어려운 것으로의 전이 학습 스케줄을 적용하여 훈련 중에 점진적으로 양자화 및 비트레이트 제약 조건의 강도를 높여 최적화의 안정성을 확보한다.
  • 비용 제약 조건을 미분 가능한 비트레이트 추정 방식으로 모델링한 복합 손실 함수를 사용하여 L2 재구성, 인지적 손실 및 적대적 손실을 결합해 네트워크를 훈련시킨다.
  • 이 프레임워크는 왜곡과 비트레이트를 동시에 최적화할 수 있어 기존 방법보다 더 나은 비용-왜곡 트레이드오프를 달성한다.

실험 결과

연구 질문

  • RQ1표준 L2 손실과 비교해 인지적 손실 및 적대적 손실을 조합함으로써 딥 이미지 압축에서 주관적 이미지 품질을 향상시킬 수 있는가?
  • RQ2제안된 쉬운 것에서 어려운 것으로의 전이 학습 전략은 CNN 기반 압축에서 비용-왜곡 최적화의 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 표준 벤치마크에서 BPG 및 WebP와 같은 최신 압축 코덱보다 BD-레이트 감소를 얼마나 달성하는가?
  • RQ4이 방법은 저비트레이트에서 다양한 이미지 콘텐츠에 걸쳐 뛰어난 MS-SSIM 성능을 유지하는가?

주요 결과

  • 제안된 방법은 공개된 Kodak 데이터셋에서 BPG 대비 평균 7.81%의 BD-레이트 감소를 달성하여 비용-왜곡 효율성이 뛰어나다는 것을 확인했다.
  • ETH Zurich의 P/M 테스트 데이터셋에서는 BPG 대비 19.1%의 BD-레이트 감소를 기록하여 다양한 이미지 세트와 도전적인 콘텐츠에서 뛰어난 성능을 보였다.
  • 인지적 손실 및 적대적 손실의 통합은 특히 저비트레이트에서 시각적 품질을 크게 향상시켰으며, 과도한 부드러움을 줄이고 질감 세부 정보를 강화했다.
  • 쉬운 것에서 어려운 것으로의 전이 학습 전략은 안정적인 훈련과 더 나은 수렴을 가능하게 하여 비용-왜곡 성능 향상에 기여했다.
  • 동일한 비트레이트에서 BPG, WebP, JPEG2000 및 JPEG보다 MS-SSIM 측정 기준으로 뛰어난 성능을 보였으며, 이는 최신 기술 수준의 성능을 확인한다.
  • 결과는 엔드 투 엔드 학습에 인지적 및 적대적 지도를 적용할 경우 표준 L2 기반 훈련 대비 더 자연스러운 재구성 결과를 도출할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.