Skip to main content
QUICK REVIEW

[논문 리뷰] Achieving on-Mobile Real-Time Super-Resolution with Neural Architecture and Pruning Search

Zheng Zhan, Yifan Gong|arXiv (Cornell University)|2021. 08. 18.
Advanced Image Processing Techniques참고 문헌 63인용 수 4
한 줄 요약

이 논문은 실시간 추론(프레임당 50ms 이내)을 달성하면서도 경쟁적인 PSNR 및 SSIM 점수를 유지하는 경량화되고 희소적인 초해상도 모델을 자동으로 생성하기 위해 공동 신경망 아키텍처 및 프루닝 탐색 프레임워크를 제안한다. 가중치 공유를 갖는 슈퍼넷을 활용하고, 세 단계로 분리된 탐색(슈퍼넷 구축, 컴파일러 인식 아키텍처 및 프루닝 탐색, 베이지안 최적화를 통한 프루닝 비율 최적화)을 통해 효율적인 종단 간 탐색을 가능하게 하여 최적의 SR 블록과 계층별 프루닝 구성 설정을 도출한다. 이로 인해 이는 모바일 플랫폼에서 처음으로 실시간 720p 초해상도를 구현한다.

ABSTRACT

Though recent years have witnessed remarkable progress in single image super-resolution (SISR) tasks with the prosperous development of deep neural networks (DNNs), the deep learning methods are confronted with the computation and memory consumption issues in practice, especially for resource-limited platforms such as mobile devices. To overcome the challenge and facilitate the real-time deployment of SISR tasks on mobile, we combine neural architecture search with pruning search and propose an automatic search framework that derives sparse super-resolution (SR) models with high image quality while satisfying the real-time inference requirement. To decrease the search cost, we leverage the weight sharing strategy by introducing a supernet and decouple the search problem into three stages, including supernet construction, compiler-aware architecture and pruning search, and compiler-aware pruning ratio search. With the proposed framework, we are the first to achieve real-time SR inference (with only tens of milliseconds per frame) for implementing 720p resolution with competitive image quality (in terms of PSNR and SSIM) on mobile platforms (Samsung Galaxy S20).

연구 동기 및 목표

  • 자원 제한된 모바일 기기에서 실시간으로 고품질 단일 이미지 초해상도(SISR)를 구현하는 데 도전하는 것.
  • 모바일 환경에서 딥러닝 기반 SISR 모델의 높은 계산 및 메모리 비용을 해결하는 것.
  • 각 계층의 추론 속도와 이미지 품질을 균형 잡기 위해 신경망 아키텍처와 프루닝 구성 설정을 공동 최적화하는 것.
  • 공유 슈퍼넷과 분리된 탐색 단계를 통해 모델 탐색 시 학습 오버헤드와 탐색 비용을 줄이는 것.
  • 경쟁적인 지각적 및 측정 품질을 확보하면서도 모바일 플랫폼에서 720p 비디오 초해상도에 대해 실시간 성능(≥20 FPS)을 달성하는 것.

제안 방법

  • 각 조합에 대해 재학습이 필요 없도록 다양한 SR 블록 및 프루닝 구성 설정 간 효율적인 탐색을 가능하게 하는 가중치 공유를 갖는 슈퍼넷을 도입한다.
  • 탐색을 세 단계로 분리한다: 슈퍼넷 구축, 컴파일러 인식 아키텍처 및 프루닝 탐색, 컴파일러 인식 프루닝 비율 탐색.
  • 베이지안 최적화(BO)를 사용해 최적의 SR 블록 및 프루닝 방식을 위한 탐색을 가속화하여 필요한 평가 수를 감소시킨다.
  • 최종 프루닝된 모델이 하드웨어 가속 기능과 호환되며 저지연 추론을 달성하도록 컴파일러 인식 탐색을 수행한다.
  • 실시간 성능을 확보하기 위해 목표 지연 시간 제약(예: ×2 및 ×3에 대해 50ms, ×4에 대해 40ms)을 기반으로 탐색 과정을 이행한다.
  • 최종 모델은 최적화된 추론 프레임워크(MNN 및 PyTorch Mobile)를 사용해 모바일 하드웨어(Samsung Galaxy S20)에서 평가된다.
Figure 1: (a) Unstructured pruning; (b) coarse-grained structured pruning (channel); (c) fine-grained structured pruning (block-based); and (d) fine-grained structured sparsity (pattern-based).
Figure 1: (a) Unstructured pruning; (b) coarse-grained structured pruning (channel); (c) fine-grained structured pruning (block-based); and (d) fine-grained structured sparsity (pattern-based).

실험 결과

연구 질문

  • RQ1신경망 아키텍처와 프루닝 구성 설정에 대한 공동 탐색 프레임워크가 모바일 기기에서 실시간 초해상도를 달성할 수 있는가?
  • RQ2슈퍼넷 기반의 가중치 공유와 분리된 탐색 단계는 SISR 모델 탐색에서 학습 및 탐색 비용을 어떻게 줄일 수 있는가?
  • RQ3전체 모델에 대해 고정된 프루닝을 적용하는 것과 비교해 계층별 적응형 프루닝 방식의 영향은 어떠한가?
  • RQ4엄격한 지연 시간 제약 조건 하에서 베이지안 최적화가 최적의 SR 블록 및 프루닝 비율 탐색을 효과적으로 가속화할 수 있는가?
  • RQ5실시간 모바일 SISR에서 추론 속도, 모델 크기, 이미지 품질(PSNR/SSIM) 간의 타당한 트레이드오프는 무엇인가?

주요 결과

  • 제안된 방법은 삼성 갤럭시 S20에서 실시간 초해상도를 달성하여, ×2 및 ×3 확대에 대해 프레임당 50ms 이내의 추론 지연 시간을 확보하고, ×4 확대에 대해선 40ms 이내를 달성한다.
  • 목표 지연 시간 50ms로 ×2 확대를 수행한 모델은 Set5에서 31.93 PSNR 및 0.8906 SSIM 점수를 기록하여 정확도와 MACs 측면에서 CARN-M 및 FALSR-C를 모두 초월한다.
  • 실시간 모델(40ms 목표)은 Set5에서 30.74 PSNR 및 0.8671 SSIM 점수를 기록하여 극도로 압축된 모델(12 MACs, 0.7M 파라미터)임에도 불구하고 경쟁 가능한 이미지 품질을 확보한다.
  • ×4 확대 작업에서 120ms 지연 시간을 기록한 모델는 SRCNN, FSRCNN 및 FEQE-P를 모두 초월하는 더 높은 PSNR 및 SSIM 점수를 기록하면서도 더 적은 MACs를 사용한다.
  • 컴파일러 최적화를 통해 이 방법은 ×2 및 ×3에서 20 FPS 이상, ×4에서 25 FPS 이상의 성능을 달성하여 MNN 및 PyTorch Mobile를 능가한다.
  • 절단 분석 결과, 아키텍처 탐색과 프루닝 탐색이 모두 필수적임을 확인: 아키텍처 탐색은 품질 향상을, 프루닝 탐색은 속도 향상을 이끌며, 두 요소의 조합이 최적의 결과를 도출한다.
Figure 2: Inference acceleration rate vs. pruning ratio of different pruning schemes. Results are measured on a Samsung Galaxy S20 smartphone, and a typical 3 $\times$ 3 CONV layer in WDSR block with 24/48 input/output channels and 320 $\times$ 180 feature size is used.
Figure 2: Inference acceleration rate vs. pruning ratio of different pruning schemes. Results are measured on a Samsung Galaxy S20 smartphone, and a typical 3 $\times$ 3 CONV layer in WDSR block with 24/48 input/output channels and 320 $\times$ 180 feature size is used.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.