Skip to main content
QUICK REVIEW

[논문 리뷰] Observer Dependent Lossy Image Compression

Maurice Weber, Cédric Renggli|arXiv (Cornell University)|2019. 10. 08.
Advanced Image Processing Techniques참고 문헌 41인용 수 6
한 줄 요약

이 논문은 인간 시각 품질(MS-SSIM를 통한) 또는 분류 정확도(VGG-16 특징을 통한)에 맞춰 조정된 관찰자 의존적 손실 압축을 제안한다. 주요 기여는 인간 인지와 분류 성능 사이의 명확한 트레이드오프를 입증한 것으로, 분류 최적화 압축은 0.25 bpp에서 Inception-ResNet-V2 정확도의 98%를 유지하며 재학습 없이 BPG 및 전통적 코덱을 능가한다.

ABSTRACT

Deep neural networks have recently advanced the state-of-the-art in image compression and surpassed many traditional compression algorithms. The training of such networks involves carefully trading off entropy of the latent representation against reconstruction quality. The term quality crucially depends on the observer of the images which, in the vast majority of literature, is assumed to be human. In this paper, we aim to go beyond this notion of compression quality and look at human visual perception and image classification simultaneously. To that end, we use a family of loss functions that allows to optimize deep image compression depending on the observer and to interpolate between human perceived visual quality and classification accuracy, enabling a more unified view on image compression. Our extensive experiments show that using perceptual loss functions to train a compression system preserves classification accuracy much better than traditional codecs such as BPG without requiring retraining of classifiers on compressed images. For example, compressing ImageNet to 0.25 bpp reduces Inception-ResNet classification accuracy by only 2%. At the same time, when using a human friendly loss function, the same compression system achieves competitive performance in terms of MS-SSIM. By combining these two objective functions, we show that there is a pronounced trade-off in compression quality between the human visual system and classification accuracy.

연구 동기 및 목표

  • 사람이 인지하는 이미지 압축 품질과 기계 시각 시스템이 인식하는 품질 간의 트레이드오프를 조사하는 것.
  • 압축된 이미지에 대해 재학습이 필요 없이 다양한 분류기로 일반화되는 압축 프레임워크를 개발하는 것.
  • 깊이 학습된 특징 기반 인지 손실 함수가 고압축 비율에서 기존 코덱보다 분류 정확도를 더 잘 유지하는지 평가하는 것.
  • 일관된 딥러닝 프레임워크 내에서 인간 또는 분류기의 관점에 따라 압축 품질을 명시적으로 최적화할 수 있음을 보여주는 것.

제안 방법

  • 이 방법은 인간 시각 품질을 위한 MS-SSIM와 분류 정확도를 위한 VGG-16 특징 재구성 손실을 조합한 두 가지 손실 함수의 볼록 조합을 사용하는 딥 네트워크 기반 이미지 압축 아키텍처를 사용한다.
  • 분류를 위한 인지 손실은 사전 학습된 VGG-16 네트워크의 중간 특징에서 계산되며, 이는 압축 모델이 후속 작업에 중요한 판별 특징을 유지하도록 한다.
  • 두 손실 함수의 가중 합을 사용해 엔드 투 엔드로 학습함으로써 인간 우호형과 분류 우도형 압축 목표 사이의 보간이 가능해진다.
  • 프레임워크는 ImageNet-1K, CUB-200-2011, Stanford Dogs 데이터셋에서 평가되었으며, 인간 인지에는 MS-SSIM, 분류 정확도에는 정확도 상위 1위를 사용하였다.
  • 압축 데이터에 대한 미세조정 없이 ImageNet-1K에서부터 라이언드 모델(RNN 기반)을 새로 학습한 압축 모델에 적용되었다.
  • 분류기 아키텍처에 관계없이 일반화 가능하며, Inception-ResNet-V2와 VGG-16 등 다양한 모델에서 일관된 성능을 보였다.

실험 결과

연구 질문

  • RQ1단일 학습된 이미지 압축 시스템이 인간 시각 인지와 기계 분류 정확도 양쪽 모두에 최적화될 수 있는가?
  • RQ2사전 학습된 분류기의 깊이 특징 기반 인지 손실을 사용하면 고압축 비율에서 기존 코덱보다 분류 정확도를 더 잘 유지하는가?
  • RQ3사람과 기계 시각 시스템 간의 압축 품질 간 트레이드오프가 측정 가능한가?
  • RQ4압축된 이미지에 대해 재학습 없이 다양한 분류기 아키텍처로 일반화되는가?
  • RQ5BPG, JPEG, WebP와 같은 최신 기술 수준의 코덱과 비교해 관찰자 의존적 압축의 성능은 MS-SSIM 및 분류 정확도 측면에서 어떻게 되는가?

주요 결과

  • 0.25 bpp에서 분류 최적화 압축 시스템은 ImageNet-1K에서 Inception-ResNet-V2의 정확도를 2%만 감소시켰으며, BPG는 19.6% 감소했다.
  • 분류 최적화 시스템은 0.25 bpp에서 ImageNet-1K에서 정확도 상위 1위 78.0%를 유지했으며, BPG(70.7%)와 JPEG(71.5%)를 크게 앞서갔다.
  • 인간 최적화 시스템은 Kodak 데이터셋에서 MS-SSIM 0.954를 기록해 BPG(0.942)와 WebP를 능가했으며, Mentzer 등(0.959)의 최신 기술 수준 방법과 유사했다.
  • 세부 시각 분류 작업(CUB-200-2011 및 Stanford Dogs)에서 분류 최적화 시스템은 모든 비트레이트에서 BPG, JPEG, WebP 및 Mentzer 등의 방법을 일관되게 뛰어넘었으며, 특히 0.5 bpp 이하에서 두드러진 성능 향상을 보였다.
  • 인간 인지와 분류 정확도 간 트레이드오프는 뚜렷했다: 한쪽을 향상시키면 다른 쪽이 손상되며, 분류 손실에 약간의 기여를 추가함으로써 정확도는 크게 향상되고 MS-SSIM 손실은 미미하게 증가했다.
  • 이 방법은 분류기 아키텍처에 관계없이 일반화되며, VGG-16 특징 기반 손실이 압축 데이터에 대해 재학습 없이도 Inception-ResNet-V2 및 기타 모델의 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.