[논문 리뷰] Learning a Single Tucker Decomposition Network for Lossy Image Compression with Multiple Bits-Per-Pixel Rates
이 논문은 터커 분해를 사용하여 다중 비트/픽셀(bpp) 속도에서 손실 압축을 수행할 수 있는 단일 딥 네ural 네트워크인 TDNet을 제안한다. 차별화 가능한 터커 분해 레이어(TDL)를 도입하여 잠재 특징을 투영 행렬과 저질서 코어 텐서로 분해함으로써, 코어 텐서의 질서와 양자화 수준을 조절하여 하나의 네트워크 내에서 압축 속도를 동적으로 조절할 수 있다. 이로 인해 단일 트레이닝된 네트워크로 다수의 bpp 설정에서 최신 기술 수준의 PSNR 및 MS-SSIM 성능을 달성한다.
Lossy image compression (LIC), which aims to utilize inexact approximations to represent an image more compactly, is a classical problem in image processing. Recently, deep convolutional neural networks (CNNs) have achieved interesting results in LIC by learning an encoder-quantizer-decoder network from a large amount of data. However, existing CNN-based LIC methods usually can only train a network for a specific bits-per-pixel (bpp). Such a "one network per bpp" problem limits the generality and flexibility of CNNs to practical LIC applications. In this paper, we propose to learn a single CNN which can perform LIC at multiple bpp rates. A simple yet effective Tucker Decomposition Network (TDNet) is developed, where there is a novel tucker decomposition layer (TDL) to decompose a latent image representation into a set of projection matrices and a core tensor. By changing the rank of the core tensor and its quantization, we can easily adjust the bpp rate of latent image representation within a single CNN. Furthermore, an iterative non-uniform quantization scheme is presented to optimize the quantizer, and a coarse-to-fine training strategy is introduced to reconstruct the decompressed images. Extensive experiments demonstrate the state-of-the-art compression performance of TDNet in terms of both PSNR and MS-SSIM indices.
연구 동기 및 목표
- 기존의 CNN 기반 손실 압축(LIC) 방법에서의 'bpp당 하나의 네트워크' 제한을 해결한다.
- 재학습 없이도 다수의 비트/픽셀(bpp) 속도를 지원하는 단일 딥 네럴 네트워크를 가능하게 한다.
- 공간적으로 다양하게 변하는 콘텐츠를 모델링하기 위해 비균일 양자화를 통해 양자화 효율을 향상시킨다.
- 粗-세밀 학습 전략과 종단 간 최적화를 통해 복원 품질을 향상시킨다.
- 압축 효율성을 높이기 위해 잠재 공간에 터커 분해를 통합하여 저질서 구조를 활용한다.
제안 방법
- 잠재 특징 맵을 코어 텐서와 다수의 투영 행렬으로 분해하는 새로운 터커 분해 레이어(TDL)를 제안한다.
- 코어 텐서의 질서와 그의 양자화 수준을 사용하여 하나의 네트워크 내에서 bpp 속도를 제어할 수 있는 조절 가능한 파ameter로 활용한다.
- 계수 분포를 기반으로 양자화 경계를 최적화하기 위한 반복적 비균일 양자화 기법을 설계한다.
- 학습 안정성 향상과 복원 품질 향상을 위해 코어-세밀 학습 전략을 구현한다.
- 재현 품질을 위해 MSE 또는 MS-SSIM 손실을 사용하여 전체 네트워크를 종단 간으로 끝까지 학습시킨다.
- 추론 중에 코어 텐서의 질서와 양자화 깊이를 동적으로 조정하여 다중 속도 압축을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 딥 네럴 네트워크가 여러 비트/픽셀(bpp) 속도에서 손실 압축을 수행할 수 있는가?
- RQ2터커 분해는 재학습 없이도 네트워크 내에서 동적 속도 제어를 가능하게 하기 위해 어떻게 통합될 수 있는가?
- RQ3비균일 양자화는 잠재 특징의 통계적 분포에 맞춰 적응함으로써 압축 효율을 향상시킬 수 있는가?
- RQ4코어-세밀 학습 전략은 종단 간 LIC 네트워크에서 복원 품질과 학습 안정성을 향상시키는가?
- RQ5단일 네트워크가 여러 bpp 속도에서 최신 기술 수준의 성능을 달성하면서도 고 PSNR 및 MS-SSIM 성능 유지를 유지할 수 있는가?
주요 결과
- MSE 손실로 학습된 TDNet은 Kodak 데이터셋에서 JPEG, JPEG2000, BPG 및 기타 딥 러닝 기반 LIC 방법보다 뛰어난 PSNR 성능을 달성한다.
- McMaster 데이터셋에서 TDNet은 BPG보다 뚜렷하게 높은 PSNR 성능을 보이며, 저비트/픽셀(bpp) 속도에서 뛰어난 성능을 보인다.
- MS-SSIM 손실로 학습된 TDNet은 상태 최고 수준의 MS-SSIM 결과를 달성하여 BPG, JPEG2000 및 대부분의 이전 딥 러닝 기반 압축기보다 뛰어나다.
- 시각적 비교 결과, TDNet은 특히 텍스처가 풍부한 영역에서 JPEG, JPEG2000, BPG 및 기타 딥 러닝 방법보다 더 선명한 윤곽선과 더 적은 잡음을 생성한다.
- 단일 네트워크를 사용하여 다양한 bpp 속도 범위에서 경쟁 가능한 성능을 달성하여, 각 속도에 맞는 별도의 모델이 필요 없어졌다.
- 반복적 비균일 양자화와 코어-세밀 학습 전략이 복원 품질 향상과 학습 안정성 향상에 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.