[논문 리뷰] Trilevel Neural Architecture Search for Efficient Single Image Super-Resolution
이 논문은 효율적인 단일 이미지 초해상도를 위한 이종적 신경망 아키텍처 탐색 프레임워크인 TrilevelNAS를 제안한다. 네트워크 수준, 셀 수준, 커널 수준의 아키텍처를 동시에 최적화함으로써 상태의 성능을 달성하면서 모델 크기와 FLOPs를 크게 감소시켰다. 트리 구조의 슈퍼넷, 스파arsed스맥, 정렬된 스파arsed스맥을 도입하여 계층적, 미분 가능하고 희소한 아키텍처 탐색을 실현하였으며, 벤치마크 데이터셋에서 기존 NAS 방법보다 정확도-효율성 트레이드오프 측면에서 뛰어난 성능을 기록하였다.
Modern solutions to the single image super-resolution (SISR) problem using deep neural networks aim not only at better performance accuracy but also at a lighter and computationally efficient model. To that end, recently, neural architecture search (NAS) approaches have shown some tremendous potential. Following the same underlying, in this paper, we suggest a novel trilevel NAS method that provides a better balance between different efficiency metrics and performance to solve SISR. Unlike available NAS, our search is more complete, and therefore it leads to an efficient, optimized, and compressed architecture. We innovatively introduce a trilevel search space modeling, i.e., hierarchical modeling on network-, cell-, and kernel-level structures. To make the search on trilevel spaces differentiable and efficient, we exploit a new sparsestmax technique that is excellent at generating sparse distributions of individual neural architecture candidates so that they can be better disentangled for the final selection from the enlarged search space. We further introduce the sorting technique to the sparsestmax relaxation for better network-level compression. The proposed NAS optimization additionally facilitates simultaneous search and training in a single phase, reducing search time and train time. Comprehensive evaluations on the benchmark datasets show our method's clear superiority over the state-of-the-art NAS in terms of a good trade-off between model size, performance, and efficiency.
연구 동기 및 목표
- 네트워크, 셀, 커널 수준 중 하나 또는 두 수준만 최적화하는 기존 NAS 기반 SISR 방법의 비효율성을 해결하여 최적의 모델 압축과 FLOPs를 달성하고자 한다.
- 트렐리스 유형의 슈퍼넷 모델링이 경로 종속성을 애매하게 만들고 탄력적인 프루닝 및 경로 최적화를 제한하는 한계를 극복하고자 한다.
- 네트워크 경로, 셀 연산, 커널 차원을 동시에 모델링하는 완전한 삼중 수준 탐색 공간을 개발하여 통합적인 아키텍처 최적화를 실현하고자 한다.
- 미분 가능 아키텍처 탐색을 통해 한 단계의 동시 탐색 및 학습을 가능하게 하여 탐색 시간을 단축하고 효율성을 향상시키고자 한다.
- 이식 가능한 장치에 적합한 모델 성능(PSNR), 크기, FLOPs, 추론 효율성 간의 우수한 균형을 달성하고자 한다.
제안 방법
- 네트워크 수준의 경로, 셀 수준의 연산(예: 리스크리드 블록), 커널 수준의 컨볼루션 필터(정의된 커널 크기 서브셋 포함)를 동시에 모델링하는 삼중 수준 탐색 공간을 도입한다.
- 네트워크 경로를 분리하여 독립적인 프루닝이 가능하고 기존 트렐리스 기반 슈퍼넷 설계 대비 메모리 효율성이 높은 트리 구조 슈퍼넷 아키텍처를 제안한다.
- 스파arsed스맥 활성화 함수를 활용해 희소한 아키텍처 분포를 생성함으로써 확대된 탐색 공간에서 효율적이고 분리된 후보 아키텍처 선택을 가능하게 한다.
- 순서 제약 조건을 도입한 정렬된 스파arsed스맥 기법을 활용해 성능 저하 없이 얕고 효율적인 네트워크 아키텍처를 유도한다.
- 사전 학습된 ESRGAN 생성기를 교사 모델로 사용하여 지식 정복을 적용함으로써 지도 학습 없이도 고성능의 학생 모델을 도출할 수 있도록 한다.
- 탐색과 학습을 하나의 단계에서 통합하는 엔드 투 엔드 미분 가능 최적화를 구현함으로써 총 탐색 및 학습 시간을 단축시킨다.
실험 결과
연구 질문
- RQ1네트워크, 셀, 커널 수준 아키텍처를 동시에 최적화하는 삼중 수준 NAS 프레임워크가 기존 방법보다 SISR에서 더 나은 효율-성능 트레이드오프를 달성할 수 있는가?
- RQ2트리 구조 슈퍼넷 설계는 트렐리스 기반 슈퍼넷 대비 경로 독립성, 프루닝 능력, 탐색 효율성 측면에서 어떻게 비교되는가?
- RQ3NAS를 위한 SISR에서 표준 소프트맥스 대비 스파ersed스맥이 아키텍처 탐색의 효율성과 희소성 측면에서 얼마나 향상되는가?
- RQ4순서 제약 조건을 가진 정렬된 스파ersed스맥 도입이 성능 저하 없이 더 컴act하고 효율적인 SISR 모델을 도출하는 데 얼마나 기여하는가?
- RQ5탐색 단계에서 유전된 가중치를 기반으로 학습하는 것이 초기 학습 대비 수렴 속도를 빠르게 하고 최종 PSNR를 향상시키는가?
주요 결과
- TrilevelNAS는 Set5에서 PSNR 30.34, Set14에서 27.29를 기록했으며, 파라미터 수는 0.34M, FLOPs는 117.39 GFLOPs에 불과하여 효율성 측면에서 AGD 및 기타 NAS 베이스라인을 압도하면서도 경쟁력 있는 성능 유지를 하였다.
- TrilevelNAS-B 버전에서는 모델 크기를 0.27M 파라미터로, FLOPs를 17.33 GFLOPs로 줄여 강력한 압축 능력을 입증하였다.
- 스파ersed스맥은 소프트맥스 대비 유사한 PSNR 성능을 달성하면서도 훨씬 작은 모델 크기와 FLOPs를 기록하여 아키텍처 탐색에서 더 뛰어난 희소성과 효율성을 보였다.
- λ = 0.1을 사용한 정렬된 스파ersed스맥은 여분의 리스크리드 블록을 성공적으로 프루닝하여 성능 저하 없이 더 얕고 효율적인 아키텍처(path [0,0,0,1,0,1])를 도출하였다.
- 탐색 단계에서 유전된 가중치를 기반으로 학습하는 것이 초기 학습 대비 더 빠른 수렴과 높은 PSNR를 제공함으로써 탐색 단계의 가중치 전이가 유의미한 이점을 제공함을 확인하였다.
- AIM 2020 챌린지 벤치마크에서 TrilevelNAS는 0.27M 파라미터와 17.33 GFLOPs로 경쟁력 있는 PSNR(28.52)를 기록하여 이식 가능한 장치에 적합한 잠재력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.