Skip to main content
QUICK REVIEW

[논문 리뷰] ClassSR: A General Framework to Accelerate Super-Resolution Networks by Data Characteristic

Xiangtao Kong, Hengyuan Zhao|arXiv (Cornell University)|2021. 03. 06.
Advanced Image Processing Techniques참고 문헌 6인용 수 11
한 줄 요약

ClassSR는 대규모 이미지(2K–8K)에서 초해상도(SR) 네트워크의 속도를 향상시키기 위해 하위 이미지들을 단순, 중간, 어려움 등 난이도 수준으로 분류하고, 각각 가벼운, 중간, 또는 전체 용량의 SR 네트워크를 적용하는 일반적인 프레임워크를 제안한다. 두 가지 새로운 손실(클래스 손실 및 평균 손실)을 함께 훈련시킴으로써 FLOPs를 최대 50% 감소시키면서 성능 저하 없이 구현하며, 노이즈 제거와 같은 다른 저수준 시각 작업으로도 일반화된다.

ABSTRACT

We aim at accelerating super-resolution (SR) networks on large images (2K-8K). The large images are usually decomposed into small sub-images in practical usages. Based on this processing, we found that different image regions have different restoration difficulties and can be processed by networks with different capacities. Intuitively, smooth areas are easier to super-solve than complex textures. To utilize this property, we can adopt appropriate SR networks to process different sub-images after the decomposition. On this basis, we propose a new solution pipeline -- ClassSR that combines classification and SR in a unified framework. In particular, it first uses a Class-Module to classify the sub-images into different classes according to restoration difficulties, then applies an SR-Module to perform SR for different classes. The Class-Module is a conventional classification network, while the SR-Module is a network container that consists of the to-be-accelerated SR network and its simplified versions. We further introduce a new classification method with two losses -- Class-Loss and Average-Loss to produce the classification results. After joint training, a majority of sub-images will pass through smaller networks, thus the computational cost can be significantly reduced. Experiments show that our ClassSR can help most existing methods (e.g., FSRCNN, CARN, SRResNet, RCAN) save up to 50% FLOPs on DIV8K datasets. This general framework can also be applied in other low-level vision tasks.

연구 동기 및 목표

  • 입력 크기 증가에 따라 FLOP이 제곱적으로 증가하는 바람에 대규모 이미지(2K–8K)에서 초해상도(SR) 처리의 높은 계산 비용을 해결한다.
  • 모든 이미지 영역에 동일한 복잡도를 적용하는 고정 아키텍처 SR 네트워크의 한계를 극복한다.
  • 아키텍처 재설계 없이도 기존 SR 모델의 속도를 향상시킬 수 있는 일반적이고 즉시 적용 가능한 프레임워크를 개발한다.
  • 복원 난이도에 따라 다른 네트워크 용량을 할당함으로써 적응형 추론을 가능하게 한다.
  • 이 프레임워크가 이미지 노이즈 제거와 같은 다른 저수준 시각 작업으로 일반화될 수 있음을 입증한다.

제안 방법

  • 입력 이미지를 작은 하위 이미지(예: 32×32)로 분해하여 국소적 처리를 수행한다.
  • 이중 모듈 파이프라인 도입: 하위 이미지를 난이도 수준(단순/중간/어려움)으로 분류하는 Class-Module과 다양한 용량의 SR 브랜치를 포함하는 네트워크 컨테이너를 적용하는 SR-Module.
  • 이중 손실 훈련 전략 설계: Class-Loss는 각 하위 이미지의 정확한 분류를 장려하고, Average-Loss는 특정 클래스에 대한 편향을 방지한다.
  • 먼저 L1 손실을 사용해 SR-Module을 훈련한 후, L1, Class-Loss, Average-Loss를 모두 사용해 Class-Module을 미세조정하고, 이후 종단 간 공동 최적화를 수행한다.
  • 다양한 채널 수와 레이어 수를 가진 SR-브랜치를 구성하여 FLOP 수준이 다른 네트워크를 만들며, 효과적인 용량 스케일링을 확보한다.
  • FSRCNN, CARN, SRResNet, RCAN 등 다양한 SR 모델에 프레임워크를 적용하고, DnCNN을 기반 네트워크로 하여 노이즈 제거 작업으로도 확장한다.

실험 결과

연구 질문

  • RQ1대규모 초해상도 입력에서 하위 이미지를 복원 난이도에 따라 효과적으로 분류하여 적응형 추론을 가능하게 할 수 있는가?
  • RQ2재구성 품질 저하 없이 분류 헤드가 하위 이미지를 적절한 SR 네트워크 브랜치에 할당할 수 있는가?
  • RQ3다양한 이미지 복잡도 수준에서 균형 잡히고 정확한 분류를 보장하기 위해 필요한 손실 함수는 무엇인가?
  • RQ4ClassSR가 다양한 SR 모델에서 FLOPs를 얼마나 줄일 수 있으며, PSNR 성능은 유지되는가?
  • RQ5이 프레임워크는 초해상도를 넘어 복원 난이도가 다양한 다른 저수준 시각 작업으로 일반화될 수 있는가?

주요 결과

  • DIV8K 데이터셋에서 ClassSR은 FSRCNN, CARN, SRResNet, RCAN 등 여러 SR 모델에서 FLOPs를 최대 50% 감소시키면서 PSNR에 변화 없이 유지한다.
  • Test8K 세트에서 ClassSR-FSRCNN는 원본 FSRCNN과 동일한 PSNR 성능을 달성하면서 FLOPs는 단 55%만 사용한다.
  • Class-Loss는 수렴에 필수적이다; Class-Loss 없이 평균 손실의 영향으로 인해 모델은 무작위 분류에 도달하게 된다.
  • Average-Loss는 가장 복잡한 브랜치에 과도하게 편향되는 것을 방지하여, 모든 입력이 가장 무거운 네트워크로 유도되는 악성 국소 최적점에서 벗어나게 한다.
  • 클래스 수에 대해 프레임워크는 강인하다: 두 개의 클래스만 있어도 성능은 유지되며, 더 많은 클래스로 증가할수록 정확도는 약간 향상된다.
  • ClassSR은 다른 저수준 작업으로 일반화된다: DnCNN을 기반으로 한 이미지 노이즈 제거에 적용했을 때, 원본 모델보다 더 높은 PSNR를 달성하면서 Test4K에서 FLOPs를 33% 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.