[논문 리뷰] Learning-Driven Lossy Image Compression; A Comprehensive Survey
이 종합적 서베이는 자동에코, 컨volution 신경망(CNN), GAN, RNN 등의 딥러닝 아키텍처를 사용한 학습 기반의 손실 압축 기법을 종합적으로 검토하며, 정적 이미지 압축을 위한 엔드 투 엔드 프레임워크에 초점을 맞춘다. 이 서베이는 줄무늬 영역 왜곡, GPU 메모리 오버플로우, 앨리어싱, CPU/GPU 호환성 부족 등의 핵심 과제를 밝혀내며, 효율성, 표준화, 하드웨어 호환성 분야에서의 최근 발전과 열린 연구 과제를 강조한다.
In the realm of image processing and computer vision (CV), machine learning (ML) architectures are widely applied. Convolutional neural networks (CNNs) solve a wide range of image processing issues and can solve image compression problem. Compression of images is necessary due to bandwidth and memory constraints. Helpful, redundant, and irrelevant information are three different forms of information found in images. This paper aims to survey recent techniques utilizing mostly lossy image compression using ML architectures including different auto-encoders (AEs) such as convolutional auto-encoders (CAEs), variational auto-encoders (VAEs), and AEs with hyper-prior models, recurrent neural networks (RNNs), CNNs, generative adversarial networks (GANs), principal component analysis (PCA) and fuzzy means clustering. We divide all of the algorithms into several groups based on architecture. We cover still image compression in this survey. Various discoveries for the researchers are emphasized and possible future directions for researchers. The open research problems such as out of memory (OOM), striped region distortion (SRD), aliasing, and compatibility of the frameworks with central processing unit (CPU) and graphics processing unit (GPU) simultaneously are explained. The majority of the publications in the compression domain surveyed are from the previous five years and use a variety of approaches.
연구 동기 및 목표
- 최근 기계학습 기반의 정적 이미지 압축 기법을 종합적으로 검토함으로써, 특히 엔드 투 엔드 딥 네트워크를 사용하는 기법들을 다루는 것.
- 학습 기반의 손실 압축 분야에서의 열린 연구 문제인 SRD, OOM, 앨리어싱, CPU/GPU 호환성 문제를 식별하고 분석하는 것.
- CAE, VAE, GAN, RNN 등의 다양한 딥러닝 모델이 전통적 기준인 JPEG 및 JPEG-2000과 비교하여 성능을 평가하는 것.
- 현재 프레임워크의 한계를 부각하고 압축 효율성과 시각적 품질 향상을 위한 향후 연구 방향을 제안함으로써 미래 연구를 이끄는 것.
제안 방법
- 자기회복 신경망(CAE, VAE), CNN, RNN, GAN, PCA, 퍼지 클러스터링 등의 딥러닝 아키텍처 기반으로 이미지 압축 방법을 분류한다.
- 학습된 엔트로피 모델과 하이퍼프리오르를 통합한 엔드 투 엔드 압축 프레임워크를 분석하여 비율-왜곡 성능 향상을 도모한다.
- 전역 특징 모델링 향상을 통해 복원 품질 향상을 위해 주의 메커니즘과 비국소 연산의 활용을 검토한다.
- 엔트로피 코딩을 위한 하이퍼프리오르 모델에 일반화된 나눗셈 정규화(GDN) 및 역 GDN 레이어의 통합을 분석한다.
- 블록 기반 및 순차적 엔트로피 모델을 평가하며, 병렬 처리 및 계산 효율성에서의 한계를 강조한다.
- 다양한 하드웨어 플랫폼(CPU 대비 GPU) 간의 모델 성능을 비교하며, 훈련 환경과 추론 환경이 다를 경우 발생하는 일관성 없는 추론 문제를 식별한다.

실험 결과
연구 질문
- RQ1비율-왜곡 트레이드오프 측면에서 가장 뛰어난 압축 효율성을 달성하는 엔드 투 엔드 학습 기반 이미지 압축 프레임워크는 무엇인가?
- RQ2어느 학습 기반 압축 모델이 재구성된 이미지에서 특히 미세한 질감과 윤곽을 잘 유지하여 뛰어난 시각적 품질을 제공하는가?
- RQ3어느 프레임워크가 GPU 메모리 사용을 최소화하고 CPU 및 GPU 플랫폼 모두에서 효율적인 추론을 지원하는가?
- RQ4어느 아키텍처가 더 빠른 반응 시간을 제공하며 고해상도 이미지의 실시간 압축을 지원하는가?
- RQ5줄무늬 영역 왜곡, 앨리어싱, 메모리 초과 오류(OOM)와 같은 지속적인 문제들은 딥러닝 기반 압축에서 어떻게 완화될 수 있는가?
주요 결과
- 특히 CNN과 자동에코를 사용하는 딥러닝 기반 압축 모델은 JPEG-2000 등의 전통적 기준보다 비율-왜곡 성능에서 뛰어나다.
- 변동형 자동에코(VAE)와 하이퍼프리오르 모델은 엔트로피 코딩 효율성을 향상시키지만, 일반적으로 더 높은 계산 비용과 메모리 사용을 야기한다.
- 줄무늬 영역 왜곡(SRD)은 재구성된 이미지에서 심각하고 아직 해결되지 않은 문제이며, 문헌상 현재까지는 해결책이 존재하지 않는다.
- 고해상도 이미지의 전체 해상도 추론 시 제한된 GPU 메모리로 인해 자주 발생하는 메모리 초과(OOM) 문제가 존재한다.
- 앨리어징 효과—특히 방향성 패턴 왜곡으로 나타나는 현상—은 저비트레이트에서 CNN 및 CAE 기반 모델에서 흔히 발생한다.
- 현재 프레임워크는 CPU와 GPU 간 이식성이 부족하여, 훈련과 추론 환경이 다를 경우 재구성 실패를 유발한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.