[논문 리뷰] Deep Perceptual Compression
이 논문은 시각적 품질을 향상시키기 위해 깊이 있는 인지적 메트릭(LPIPS)과 MS-SSIM을 동시에 최적화하는 학습된 이미지 압축 방법인 딥 퍼셉추얼 컴프레션(DPC)을 제안한다. DPC는 인간 평가에서 딥 러닝 기반 방법과 JPEG-2000를 능가하며, 특히 저비트레이트에서 객체 검출 정확도의 열화가 상대적으로 적다.
Several deep learned lossy compression techniques have been proposed in the recent literature. Most of these are optimized by using either MS-SSIM (multi-scale structural similarity) or MSE (mean squared error) as a loss function. Unfortunately, neither of these correlate well with human perception and this is clearly visible from the resulting compressed images. In several cases, the MS-SSIM for deep learned techniques is higher than say a conventional, non-deep learned codec such as JPEG-2000 or BPG. However, the images produced by these deep learned techniques are in many cases clearly worse to human eyes than those produced by JPEG-2000 or BPG. We propose the use of an alternative, deep perceptual metric, which has been shown to align better with human perceptual similarity. We then propose Deep Perceptual Compression (DPC) which makes use of an encoder-decoder based image compression model to jointly optimize on the deep perceptual metric and MS-SSIM. Via extensive human evaluations, we show that the proposed method generates visually better results than previous learning based compression methods and JPEG-2000, and is comparable to BPG. Furthermore, we demonstrate that for tasks like object-detection, images compressed with DPC give better accuracy.
연구 동기 및 목표
- 기존의 PSNR 및 MS-SSIM과 같은 전통적 메트릭이 학습된 이미지 압축에서 인간 인지와 빈도가 떨어지는 문제를 해결하기 위해.
- 딥 러닝 기반 압축에서 MS-SSIM를 대체하거나 보완하기 위해 더 깊이 있는 인지적 메트릭을 도입하여 인지적 품질을 향상시키기 위해.
- 인간 평가에 의한 시각적 품질이 MS-SSIM이나 PSNR보다 학습된 인지적 메트릭에 더 잘 반영됨을 입증하기 위해.
- 압축된 이미지가 후속 컴퓨터 비전 작업, 특히 객체 검출에 얼마나 유용한지 평가하기 위해.
- 최신 학습된 및 전통적 코덱보다 DPC가 더 나은 시각적 품질과 낮은 작업 성능 열화를 달성함을 보여주기 위해.
제안 방법
- 이 방법은 엔코더-디코더 신경망 아키텍처를 사용하여 엔드 투 엔드 학습을 수행하는 이미지 압축을 위한 것이다.
- 두 손실 요소를 동시에 최적화한다: 학습된 인지적 이미지 패치 유사도(LPIPS) 메트릭과 MS-SSIM을 통해 인지적 품질과 구조적 정밀도를 균형 잡는다.
- LPIPS 메트릭은 인간 평가 데이터를 기반으로 이미지 왜곡 인지에 대해 사전 훈련된 CNN을 사용하여 계산된다.
- 체스보드 아티팩트를 줄이기 위해, 커널 크기가 스트라이드로 나누어떨어지도록 디컨볼루션 업샘플링 레이어를 설계하여 겹치는 필터 패턴을 방지한다.
- 최적화를 정규화하기 위해 LPIPS(낮을수록 좋음)와 MS-SSIM(높을수록 좋음)을 조합한 다중 작업 손실을 사용하여 모델을 훈련시킨다.
- 평가에는 인간 인지 연구, PSNR/MS-SSIM 비교, 그리고 ResNet-101 기반 사전 훈련된 Faster R-CNN을 사용한 MS-COCO 데이터셋에서의 객체 검출 성능 평가가 포함된다.
실험 결과
연구 질문
- RQ1딥 이미지 압축에서 학습된 인지적 메트릭(LPIPS)을 최적화하는 것이 MS-SSIM이나 PSNR를 최적화하는 것보다 더 나은 시각적 품질을 이끌어내는가?
- RQ2인간 평가에서 DPC의 인지적 품질은 다른 학습된 및 전통적 코덱(JPEG-2000, BPG 등)과 비교해 어떻게 되는가?
- RQ3DPC는 다른 압축 방법에 비해 후속 컴퓨터 비전 작업(예: 객체 검출)에 대해 얼마나 잘 유지되는가?
- RQ4LPIPS와 MS-SSIM을 다중 작업 손실로 조합하면 학습된 압축에서 인지적 품질과 구조적 유사도를 동시에 향상시킬 수 있는가?
- RQ5기존 학습된 압축 모델에서 높은 MS-SSIM 점수와 낮은 인간 인지 간의 괴리가 존재하는가, 그리고 DPC는 이를 완화할 수 있는가?
주요 결과
- DPC는 Kodak, Urban100, Set14, Set5 데이터셋에서 모든 테스트 비트레이트에서 가장 높은 인간 평가 인지 품질을 달성했으며, 딥 러닝 기반 방법과 JPEG-2000를 모두 능가했다.
- 어떤 방법들(예: Mentzer et al. 및 Ballé et al.)보다 낮은 MS-SSIM 점수를 기록했음에도 불구하고, DPC는 인간 평가에서 일관되게 높은 순위를 차지하여 MS-SSIM이 인지적 품질의 나쁜 대체 지표임을 입증했다.
- 0.37 bpp에서 DPC는 BPG와 동등하거나 뛰어나며, 0.23 bpp에서는 인간 평가에서 모든 다른 방법을 뛰어넘었다.
- MS-COCO 데이터셋에서 DPC는 모든 방법 중에서 객체 검출 성능(AP@[.5:.95]) 열화가 가장 적었으며, 특히 저비트레이트(예: 0.23 bpp)에서 BPG조차도 일부 경우에서 DPC에 뒤지지 않았다.
- LPIPS는 PSNR나 MS-SSIM보다 인간 인지와 더 잘 상관관계가 있으며, 이는 높은 MS-SSIM 점수를 기록한 방법들이 종종 낮은 인간 평가 점수를 받기 때문이다.
- LPIPS와 MS-SSIM을 다중 작업 손실로 조합하면, 단독으로 각각 사용할 경우보다 더 시각적으로 우수한 복원 결과와 더 나은 후속 작업 성능을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.