Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Kernel-Based Adaptive Spatial Aggregation for Learned Image Compression

Huairui Wang, Nianxiang Fu|arXiv (Cornell University)|2023. 08. 17.
Advanced Data Compression TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 동적 커널 기반의 적응형 공간 집합을 활용하여 수용 영역의 유연성과 콘텐츠 인식 특징 집합을 향상시키는 동적 커널 기반 이미지 압축(DKIC)을 제안한다. 라이트 변형 가능 컨벌루션(LDCN)과 일반화된 군집-세분화 엔트로피 모델, 비대칭 공간-채널 모델링을 통합하여 중간 수준의 모델 복잡도로 최신 기술 수준의 비율-왜곡 성능을 달성하며, 표준 벤치마크에서 VTM-12.1 및 최신 기술 수준의 방법들을 능가한다.

ABSTRACT

Learned image compression methods have shown superior rate-distortion performance and remarkable potential compared to traditional compression methods. Most existing learned approaches use stacked convolution or window-based self-attention for transform coding, which aggregate spatial information in a fixed range. In this paper, we focus on extending spatial aggregation capability and propose a dynamic kernel-based transform coding. The proposed adaptive aggregation generates kernel offsets to capture valid information in the content-conditioned range to help transform. With the adaptive aggregation strategy and the sharing weights mechanism, our method can achieve promising transform capability with acceptable model complexity. Besides, according to the recent progress of entropy model, we define a generalized coarse-to-fine entropy model, considering the coarse global context, the channel-wise, and the spatial context. Based on it, we introduce dynamic kernel in hyper-prior to generate more expressive global context. Furthermore, we propose an asymmetric spatial-channel entropy model according to the investigation of the spatial characteristics of the grouped latents. The asymmetric entropy model aims to reduce statistical redundancy while maintaining coding efficiency. Experimental results demonstrate that our method achieves superior rate-distortion performance on three benchmarks compared to the state-of-the-art learning-based methods.

연구 동기 및 목표

  • 학습 기반 이미지 압축에서 표준 컨벌루션과 윈도우 기반 어텐션의 고정된 범위 공간 집합의 한계를 극복하기 위해.
  • 더 나은 특징 표현을 위해 콘텐츠 조건부 동적 커널 오프셋을 가능하게 함으로써 수용 영역 적응성을 향상시키기 위해.
  • 전역, 채널별, 공간적 맥락을 통합하여 개선된 분포 추정을 위한 일반화된 군집-세분화 엔트로피 모델을 설계하기 위해.
  • 군집화된 잠재 분포에 맞춰 공간 및 채널 맥락을 다르게 모델링함으로써 통계적 중복을 줄이기 위해.
  • 수용 가능한 모델 복잡도와 추론 속도를 유지하면서도 뛰어난 비율-왜곡 성능를 달성하기 위해.

제안 방법

  • 내용에 적응하는 커널 오프셋과 그룹 공유 가중치를 학습하는 데 기반한 라이트 변형 가능 컨벌루션(LDCN) 기반의 동적 커널 메커니즘을 도입하여 영역 집합의 유연성을 향상시킨다.
  • 후정규화와 동적 커널 레이어를 갖춘 잔차 버블록을 활용하여 비선형 표현 학습을 향상시킨다.
  • 전역 맥락, 채널별 의존성, 공간 맥락을 동시에 모델링하여 개선된 분포 추정을 위한 일반화된 군집-세분화 엔트로피 모델을 제안한다.
  • 잠재 그룹 특성에 따라 공간 및 채널 맥락을 다르게 모델링함으로써 중복을 줄이는 비대칭 공간-채널 엔트로피 모델을 설계한다.
  • 경로 적분 기반 기울기와 함께 局부 기여도 맵(LAM)을 활용하여 다양한 방법의 효과적 수용 영역(ERF)을 시각화하고 분석한다.
  • 정확도와 속도의 균형을 맞추기 위해 공동 자동 회귀 엔트로피 모델링과 점진적 맥락 정밀화를 포함한 이단계 학습 전략을 채택한다.

실험 결과

연구 질문

  • RQ1동적 커널 기반 공간 집합은 학습 기반 이미지 압축에서 수용 영역 적응성과 콘텐츠 인식 특징 학습을 향상시킬 수 있는가?
  • RQ2군집-세분화 엔트로피 모델링 통합이 잠재 표현의 확률 추정과 중복 감소에 어떻게 기여하는가?
  • RQ3비대칭 공간-채널 엔트로피 모델은 통계적 중복을 어느 정도 줄이며 코드화 효율성을 유지하는가?
  • RQ4최신 기술 수준의 학습 기반 압축 모델과 비교해 본 결과, 제안된 방법은 비율-왜곡 성능 및 계산 비용 측면에서 어떻게 성과를 내는가?
  • RQ5동적 커널 설계는 재구성에서 효과적 수용 영역의 형태와 특징의 중요도에 어떤 영향을 미치는가?

주요 결과

  • DKIC는 Kodak, CLIC 및 기타 벤치마크에서 비교된 모든 방법들 중에서 최고의 비율-왜곡 성능를 기록하며, VTM-12.1 및 STF, InvComp와 같은 최신 기술 수준의 방법들을 능가한다.
  • 효과적 수용 영역(ERF) 시각화 결과 DKIC는 고정 커널 또는 윈도우 어텐션 방법과 달리 더 많은 관련성 있고 콘텐츠 조건부 영역—타원형으로 집중된 영역—을 포착함을 확인하였다.
  • 단일 RTX 3090에서 768×512 이미지당 약 150ms의 코드화 시간을 기록하며, Cheng2020 및 InvComp와 같은 자동 회귀 방법보다 빠른 속도를 기록하면서도 뛰어난 RD 성능를 유지한다.
  • 제안된 비대칭 공간-채널 엔트로피 모델은 중복 감소를 가능하게 하며, 맥락 모델링 전략에 대한 분석 실험을 통해 높은 코드화 효율성을 입증하였다.
  • 후정규화를 적용한 동적 잔차 블록 설계(LN을 LDCN 및 MLP 이후에 적용)가 가장 뛰어난 성능를 기록하였으며, 이는 다른 트랜스포머 및 CNN 아키텍처의 연구 결과와 일치한다.
  • DKIC는 53.3M 파라미터를 가지며, SwinT-ChARM(60.5M)보다 더 효율적이며, STF(99.8M)보다는 크게 효율적이지만 여전히 뛰어난 RD 성능를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.