[논문 리뷰] DSSLIC: Deep Semantic Segmentation-based Layered Image Compression
이 논문은 의미 분할 맵을 기본 레이어로 사용하고, 압축된 이미지 표현과 잔차를 향상 레이어로 인코딩하는 딥러닝 기반 이미지 압축 프레임워크인 DSSLIC를 제안한다. 의미 인식 복원 및 생성적 정밀화를 활용하여 DSSLIC는 다양한 비트레이트에서 BPG, JPEG2000, WebP 및 JPEG보다 뛰어난 PSNR 및 MS-SSIM 성능을 달성하며, 객체 기반 압축 및 이미지 검색과 같은 의미 인식 애플리케이션을 가능하게 한다.
Deep learning has revolutionized many computer vision fields in the last few years, including learning-based image compression. In this paper, we propose a deep semantic segmentation-based layered image compression (DSSLIC) framework in which the semantic segmentation map of the input image is obtained and encoded as the base layer of the bit-stream. A compact representation of the input image is also generated and encoded as the first enhancement layer. The segmentation map and the compact version of the image are then employed to obtain a coarse reconstruction of the image. The residual between the input and the coarse reconstruction is additionally encoded as another enhancement layer. Experimental results show that the proposed framework outperforms the H.265/HEVC-based BPG and other codecs in both PSNR and MS-SSIM metrics across a wide range of bit rates in RGB domain. Besides, since semantic segmentation map is included in the bit-stream, the proposed scheme can facilitate many other tasks such as image search and object-based adaptive image compression.
연구 동기 및 목표
- 압축 효율성과 의미 유용성을 향상시키기 위해 의미 분할을 통합한 학습 기반 이미지 압축 프레임워크를 개발하는 것.
- JPEG, JPEG2000 및 WebP와 같은 전통적 코덱의 한계를 극복하기 위해 딥러닝을 활용해 더 나은 비율-왜곡 성능을 달성하는 것.
- 압축 비트스트림에 직접 의미 분할 맵을 통합하여 객체 수준의 이미지 조작 및 검색을 가능하게 하는 것.
- 낮은 비트레이트에서 의미 맵과 잔차 학습을 활용한 고정밀도 이미지 복원의 가능성 탐색.
- 다층적이고 의미 인식 기반의 인코딩을 통해 압축 이미지의 시각적 품질과 구조적 정밀도 향상.
제안 방법
- 입력 이미지는 먼저 깊이 신경망을 통해 처리되어 의미 분할 맵을 생성하고, 이는 비손실적으로 비트스트림의 기본 레이어로 인코딩된다.
- 특화된 네트워크(CompNet)를 사용하여 입력 이미지의 압축 표현을 추출하고 첫 번째 향상 레이어로 인코딩된다.
- 분할 맵과 압축 이미지 표현을 활용해 복원 네트워크(FineNet)를 통해 근사 복원을 생성하며, 이는 고주파 세부 정보를 예측한다.
- 원본 이미지와 근사 복원 간의 잔차를 계산하고 두 번째 향상 레이어로 인코딩하여 정밀도를 향상시킨다.
- 시각적 자연스러움 향상을 위해 생성적 적대 신경망(GAN)이 사용되며, 훈련 중에 시각적 손실(VGG 및 DIS)이 사용된다.
- 프레임워크는 세 구성 요소로 이루어진 계층적 비트스트림 아키텍처를 사용한다: 기본 레이어(분할 맵), 첫 번째 향상 레이어(압축 이미지), 두 번째 향상 레이어(잔차).
실험 결과
연구 질문
- RQ1의미 분할 맵이 이미지 압축에서 효과적으로 기본 레이어로 사용될 수 있는가? 이는 비율-왜곡 성능 향상에 기여하는가?
- RQ2압축 표현과 잔차 인코딩을 통합함으로써 기존 코덱 대비 복원 품질이 어떻게 향상되는가?
- RQ3비트스트림에 의미 정보를 통합할 경우, 이미지 검색 및 객체 기반 압축과 같은 후행 작업에 얼마나 기여하는가?
- RQ4시각적 손실(VGG 및 DIS)이 제안된 프레임워크에서 시각적 품질과 PSNR에 미치는 영향은 무엇인가?
- RQ5다양한 비트레이트에서 DSSLIC 프레임워크가 BPG, JPEG2000, WebP 및 JPEG과 같은 최신 코덱 대비 PSNR 및 MS-SSIM 측면에서 어떻게 비교되는가?
주요 결과
- RGB(4:4:4) 도메인에서 다양한 비트레이트 범위에서 DSSLIC는 H.265/HEVC 기반 BPG 코덱보다 PSNR 및 MS-SSIM 모두에서 뛰어난 성능을 보였다.
- 일부 Kodak 테스트 이미지에서 DSSLIC는 동일한 비트레이트에서 BPG 대비 약 4.7 dB의 PSNR 향상을 달성했다.
- ADE20K 데이터셋에서 DSSLIC는 0.18 bpp에서 PSNR 30.87 dB, 0.12 bpp에서 PSNR 34.72 dB를 기록했으며, 이는 BPG 및 WebP를 크게 앞서는 성능이었다.
- 시각적 비교에서 DSSLIC는 특히 복잡한 장면에서 BPG, WebP, JPEG2000 및 JPEG보다 더 선명하고 시각적으로 자연스러운 이미지를 생성했다.
- 제거 실험 결과, 분할 맵 사용(WithSeg)이 NoSeg 설정 대비 PSNR와 시각적 품질을 향상시켰으며, 특히 무늬 및 윤곽 영역에서 두드러졌다.
- 시각적 손실 사용( synth 구성)은 시각적 품질을 향상시켰지만 PSNR를 감소시켜, 시각적 품질과 목적적 지표 간의 상충 관계를 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.