Skip to main content
QUICK REVIEW

[논문 리뷰] Faster and Accurate Classification for JPEG2000 Compressed Images in Networked Applications

Lahiru D. Chamain, Zhi Ding|arXiv (Cornell University)|2019. 09. 04.
Advanced Data Compression Techniques참고 문헌 13인용 수 6
한 줄 요약

이 논문은 RGB 이미지로의 복원 없이 CDF 9/7 웨이블릿에서 유도된 이산 웨이블릿 변환(DWT) 계수를 직접 사용하여 JPEG2000 압축 이미지를 분류하는 방법을 제안한다. 이는 더 빠르고 정확한 딥러닝 추론을 가능하게 한다. DWT 계수를 기반으로 얕은 컨volution 신경망을 훈련하고 도메인 특화 데이터 증강 기법을 도입함으로써, CIFAR-10에서는 최대 2.5% 높은 상위-1 정확도와 Tiny ImageNet에서는 1.5% 향상된 성능를 달성하였으며, 전이 학습을 통해 훈련 속도를 75% 빠르게 하였고, 비용이 많이 드는 복원 과정을 제거하였다.

ABSTRACT

JPEG2000 (j2k) is a highly popular format for image and video compression.With the rapidly growing applications of cloud based image classification, most existing j2k-compatible schemes would stream compressed color images from the source before reconstruction at the processing center as inputs to deep CNNs. We propose to remove the computationally costly reconstruction step by training a deep CNN image classifier using the CDF 9/7 Discrete Wavelet Transformed (DWT) coefficients directly extracted from j2k-compressed images. We demonstrate additional computation savings by utilizing shallower CNN to achieve classification of good accuracy in the DWT domain. Furthermore, we show that traditional augmentation transforms such as flipping/shifting are ineffective in the DWT domain and present different augmentation transformations to achieve more accurate classification without any additional cost. This way, faster and more accurate classification is possible for j2k encoded images without image reconstruction. Through experiments on CIFAR-10 and Tiny ImageNet data sets, we show that the performance of the proposed solution is consistent for image transmission over limited channel bandwidth.

연구 동기 및 목표

  • 클라우드 기반 딥러닝 파이프라인에서 JPEG2000 압축 이미지에 대한 계산 비용이 많이 드는 이미지 복원 단계를 제거하기 위해.
  • j2k 스트림에서 추출한 DWT 계수를 직접 사용해 컨volution 신경망을 훈련시킴으로써 분류 정확도와 추론 속도를 향상시키기 위해.
  • 기존의 공간 기반 변환 기법보다 우수한 성능을 보이는 DWT 도메인에 특화된 효과적인 데이터 증강 기법을 개발하기 위해.
  • 압축된 이미지에 대해 사전 훈련된 모델을 효율적으로 미세조정할 수 있음을 보여주기 위해.
  • 대역폭 제약이 있는 네트워크 환경에서 DWT 도메인 분류의 강건성과 효율성을 검증하기 위해.

제안 방법

  • 압량화 이후에 디코더에 접근하여 표준 JPEG2000 비트스트림에서 CDF 9/7 DWT 계수를 직접 추출한다.
  • 재구성된 RGB 이미지 대신 DWT 계수를 입력으로 사용해 딥 컨volution 신경망을 훈련시킴으로써 웨이블릿 도메인에서의 엔드 투 엔드 학습을 가능하게 한다.
  • 신호 구조를 유지하면서 압축에 대한 강건성을 향상시키는 DWT 계수 수준의 뒤집기 및 이동과 같은 새로운 증강 기법을 설계한다.
  • RGB 도메인의 깊은 모델 대비 정확도를 유지하거나 향상시키면서 계산 비용을 줄이기 위해 DWT 도메인에서 얕은 컨volution 신경망 아키텍처를 사용한다.
  • 압축된 환경에서 저대역폭 상황을 고려해 압축되지 않은 이미지에서 사전 훈련된 모델을 미세조정하여 훈련 시간을 75% 감소시킨다.
  • CIFAR-10과 Tiny ImageNet에서 테스트 정확도, 훈련/추론 속도, 다양한 압축 비율 하에서의 강건성 등을 측정하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1RGB 복원 없이 JPEG2000 압축 이미지에 대해 깊은 컨볼루션 신경망이 높은 분류 정확도를 달성할 수 있는가?
  • RQ2DWT 계수를 기반으로 얕은 네트워크 아키텍처를 사용해 훈련하면 추론 및 훈련 속도가 빨라지면서도 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ3기존의 공간 기반 데이터 증강 기법(예: 뒤집기 및 이동)은 DWT 도메인에서 효과적인가, 아니면 해로운가?
  • RQ4압축된, 대역 제한이 있는 상황에서 압축되지 않은 도메인에서 사전 훈련된 모델을 효과적으로 미세조정할 수 있는가?
  • RQ5DWT 도메인 모델과 RGB 도메인 모델을 비교했을 때, 채널 대역폭이 감소함에 따라 분류 성능는 어떻게 변화하는가?

주요 결과

  • 제안된 방법은 DWT 계수와 새로운 증강 기법을 사용해 CIFAR-10에서 91.92%의 상위-1 정확도를 달성하였으며, RGB 기반 모델의 91.70%보다 높은 성능이다.
  • Tiny ImageNet에서는 DWT 도메인 모델이 67.56%의 상위-1 정확도를 기록하여 기준 RGB 모델의 65.78%보다 1.78% 높은 성능이다.
  • 사전 훈련된 모델에서 미세조정할 경우 DWT 도메인 모델은 훈련 시간을 RGB 도메인과 동일하게 75% 감소시켰다.
  • CIFAR-10에서 DWT 모델은 4283장/초의 추론 속도를 기록하여 RGB 모델의 4108장/초보다 약 4% 빠르며, 복원 비용이 전혀 없었다.
  • 대역폭 제약 조건 하에서도 정확도를 유지하거나 향상시키며, 압축 비율이 증가할수록 DWT 모델이 점점 더 높은 정확도 향상을 보였다.
  • DWT 전용 증강 기법을 사용함으로써 CIFAR-10에서 상위-1 정확도가 2.5% 향상되었고, Tiny ImageNet에서는 1% 이상 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.