[논문 리뷰] RepNAS: Searching for Efficient Re-parameterizing Blocks
RepNAS는 블록당 임의의 브랜치 수를 허용하는 민첩한 검색 공간을 갖춘 새로운 일단계 NAS 프레임워크를 제안하며, 이는 각 블록에서 효율적이고 재패러미터화 가능한 다양한 브랜치 블록(ODBBs)을 탐색한다. 메모리 제약 조건 하에서 블록 단위 가중치 공유와 동적 프루닝을 통한 기울기 기반 아키텍처 탐색을 사용함으로써, RepNAS는 추론 속도가 단일 경로 모델과 유사한 수준에서 ImageNet에서 최고 성능을 달성하며, 유사한 지연 시간 제약 조건 하에서 인간이 설계한 모델과 이전 NAS 모델을 모두 능가한다.
In the past years, significant improvements in the field of neural architecture search(NAS) have been made. However, it is still challenging to search for efficient networks due to the gap between the searched constraint and real inference time exists. To search for a high-performance network with low inference time, several previous works set a computational complexity constraint for the search algorithm. However, many factors affect the speed of inference(e.g., FLOPs, MACs). The correlation between a single indicator and the latency is not strong. Currently, some re-parameterization(Rep) techniques are proposed to convert multi-branch to single-path architecture which is inference-friendly. Nevertheless, multi-branch architectures are still human-defined and inefficient. In this work, we propose a new search space that is suitable for structural re-parameterization techniques. RepNAS, a one-stage NAS approach, is present to efficiently search the optimal diverse branch block(ODBB) for each layer under the branch number constraint. Our experimental results show the searched ODBB can easily surpass the manual diverse branch block(DBB) with efficient training.
연구 동기 및 목표
- 신경망 아키텍처 탐색(NAS) 성능과 실세계 추론 속도 사이의 격차를 해소하기 위해, 구조적 재패러미터화와 호환되는 검색 공간을 설계한다.
- 메모리 사용량이 높고 최적의 브랜치 구성이 아닌 고정된 수동으로 설계된 다중 브랜치 블록(예: RepVGG, ACB)의 한계를 극복한다.
- 재학습 없이도 자동으로 종단 간 아키텍처 탐색을 통해 최적의 다양한 브랜치 블록(ODBBs)을 탐색할 수 있도록 하되, 단일 경로 융합을 통해 빠른 추론을 유지한다.
- GPU 메모리 제약 조건 하에서 더 큰 모델로 확장 가능한 메모리 효율적인 훈련 전략을 개발한다. 이 전략은 역전파 동안 중요도가 낮은 브랜치를 동적으로 프루닝한다.
제안 방법
- 각 블록이 훈련 중에 임의의 수의 브랜치를 독립적으로 유지하고 추론 시에 단일 경로로 융합될 수 있도록 하는 새로운 검색 공간인 Rep 검색 공간을 제안한다.
- 블록 단위로 아키텍처 파라미터를 업데이트하는 기울기 기반 NAS 방법인 RepNAS를 도입한다. 이는 개별 엣지가 아닌 전체 브랜치의 중요도를 학습한다.
- 스уп넷에서 블록 단위 가중치 공유를 적용하여 효율적인 훈련을 가능하게 하고, 재학습 없이도 정확한 아키텍처 순위를 매길 수 있도록 한다.
- 메모리 인지 훈련 전략을 구현한다: 각 전방향 프로퍼게이션 동안 중요도가 낮은 브랜치(온도 조절 게이트에 의해 결정됨)가 순차적으로 프루닝되어 GPU 메모리 제약 조건을 충족시킨다.
- 온도 파rameter를 사용한 미분 가능 아키텍처 탐색(DARTS 스타일)을 적용하여 부드럽게 브랜치 중요도를 할당하고, 네트워크 및 아키텍처 파라미터를 동시에 업데이트할 수 있도록 기울기 흐름을 허용한다.
- 훈련 후, 모든 중요도가 높은 브랜치를 단일 경로 모델로 융합하여 최종 ODBB를 도출함으로써 재학습 없이 직접 배포가 가능하다.
실험 결과
연구 질문
- RQ1임의의 브랜치 수를 허용하면서도 효율적이고 단일 경로 추론이 가능한 재패러미터화 가능한 민첩한 검색 공간을 설계할 수 있는가?
- RQ2메모리 제약 조건 하에서 재학습 없이도 효과적으로 최적의 다양한 브랜치 블록(ODBBs)을 탐색할 수 있는 일단계 NAS 방법이 가능한가?
- RQ3훈련 중에 중요도가 낮은 브랜치를 동적으로 프루닝하는 것이 성능 저하 없이 메모리 효율성을 향상시키는가?
- RQ4제안된 방법이 인간이 설계한 블록(예: RepVGG, ACB)과 이전 NAS 모델보다 정확도와 지연 시간의 상호 보완성에서 뛰어나게 성능을 냈는가?
주요 결과
- 검색된 ODBB-A0는 객체 검출에서 COCO AP 31.4%를 달성하며 추론 시간이 0.048초로, 빠른 속도에서 ResNet-18(28.1% AP)을 능가한다.
- ODBB-B3는 추론 시간 0.148초 동안 COCO AP 37.3%를 달성하여, 유사한 지연 시간에서 ResNet-101(34.6% AP)보다 2.7% AP 높은 성능을 보였다.
- 오직 50개의 브랜치만을 사용한 ODBB는 RepVGG(66개 브랜치), DBB(88개 브랜치), ACB(66개 브랜치)보다 높은 정확도를 달성하여 뛰어난 효율성을 입증했다.
- 75개 브랜치를 가진 ODBB는 더 큰 구성과 동등한 성능을 보였으며, 이는 일정 수 이상의 브랜치 수에서 수익 감소 현상이 나타남을 시사한다.
- 스уп넷에서의 가중치 공유 덕분에 샘플링된 하위 네트워크의 수렴 속도가 빨라지고 성능이 더 안정적이게 되었다.
- RepNAS로 훈련된 슈퍼넷은 높은 성능의 하위 네트워크를 효과적으로 순위 매기며, 훈련 에포크 수에 걸쳐 일관되게 높고 안정적인 정확도를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.