[논문 리뷰] Partial Order Pruning: for Best Speed/Accuracy Trade-off in Neural Architecture Search
이 논문은 네트워크 폭과 깊이에 기반한 부분 순서 가정을 활용해 검색 공간을 정제하는, 부분 순서 정렬(Partial Order Pruning)을 제안한다. 이는 속도/정확도 트레이드오프를 명시적으로 최적화하며, 임베디드 디바이스와 고성능 GPU 모두에서 최신 기술 수준의 속도/정확도 성능을 달성한다. DF-Seg 네트워크는 1080Ti에서 106.4 FPS, mIoU 74.1%를 기록했고, TX2에서는 720p에서 21.8 FPS를 달성한다.
Achieving good speed and accuracy trade-off on a target platform is very important in deploying deep neural networks in real world scenarios. However, most existing automatic architecture search approaches only concentrate on high performance. In this work, we propose an algorithm that can offer better speed/accuracy trade-off of searched networks, which is termed "Partial Order Pruning". It prunes the architecture search space with a partial order assumption to automatically search for the architectures with the best speed and accuracy trade-off. Our algorithm explicitly takes profile information about the inference speed on the target platform into consideration. With the proposed algorithm, we present several Dongfeng (DF) networks that provide high accuracy and fast inference speed on various application GPU platforms. By further searching decoder architectures, our DF-Seg real-time segmentation networks yield state-of-the-art speed/accuracy trade-off on both the target embedded device and the high-end GPU.
연구 동기 및 목표
- 정확도를 우선시하고 FLOPs를 효율성의 대리 지표로 사용하는 기존 신경망 아키텍처 탐색 방법의 단점을 보완하기 위해.
- FLOPs나 간접 지표가 아닌, 타겟 플랫폼에서의 실제 추론 지연 시간을 명시적으로 고려하는 검색 알고리즘을 개발하기 위해.
- 같은 깊이/폭 제약 조건 하에서 더 얇거나 얕은 대안보다 성능이 열 劣한 아키텍처를 조기에 정제함으로써 더 나은 속도/정확도 트레이드오프를 달성하기 위해.
- 실시간 세그멘테이션을 위한 효율적인 백본 및 디코더 아키텍처를 설계하여 임베디드 및 고성능 GPU 양쪽에서 높은 정확도를 유지하면서 지연 시간을 최소화하기 위해.
제안 방법
- 부분 순서 정렬 알고리즘은 부분 순서 가정을 사용한다: 더 넓은 네트워크가 더 얕은 네트워크와 같은 깊이를 가질 경우, 더 효율적일 수 없으므로 더 넓은 변형은 조기에 정제된다.
- 이 방법은 타겟 플랫폼에서의 실제 추론 속도 측정치를 검색 과정에 통합하여, FLOPs 기반 추정 대신 실제 지연 시간 프로파일링을 사용한다.
- 강화 학습, 진화 전략, 기울기 기반 최적화를 피하기 위해 컷팅 플레인 알고리즘을 활용해 잔여 검색 공간을 효율적으로 탐색한다.
- 검색은 백본 및 디코더 아키텍처 양쪽에 걸쳐 수행되어 세그멘테이션 작업을 위한 종단 간 최적화가 가능하다.
- 알고리즘은 특정 하드웨어 플랫폼에서 속도와 정확도를 최적화한 네트워크 세트—Dongfeng(DF) 네트워크를 생성한다.
- DF-Seg는 DF 백본과 검색된 디코더 아키텍처를 조합하여 만들어지며, 높은 효율성과 정확도를 달성한다.
실험 결과
연구 질문
- RQ1타겟 하드웨어에서 실제 추론 지연 시간을 명시적으로 모델링함으로써 신경망 아키텍처 탐색 알고리즘이 더 나은 속도/정확도 트레이드오프를 달성할 수 있는가?
- RQ2FLOPs가 실제 성능과 부적합한 대리 지표인 경우, 고품질 솔루션을 유지하면서 아키텍처 탐색을 어떻게 가속화할 수 있는가?
- RQ3폭과 깊이에 대한 부분 순서 가정을 활용해 검색 과정의 초기 단계에서 열 劣한 아키텍처를 정제할 수 있는가?
- RQ4임베디드 및 고성능 GPU에서 실시간 세그멘테이션의 달성 가능한 속도/정확도 경계는 무엇인가?
주요 결과
- GTX 1080Ti에서 DF1-Seg 네트워크는 1024×2048 해상도에서 106.4 FPS, mIoU 74.1%를 기록하여 BiSeNet1과 BiSeNet2보다 빠르고 정확도가 높다.
- TX2에서 DF1-Seg 네트워크는 1280×720 해상도에서 21.8 FPS를 기록하여 임베디드 하드웨어에서 뛰어난 성능을 보였다.
- DF1 네트워크는 ResNet-18과 유사한 ImageNet top-1 정확도를 달성했지만, 43% 낮은 지연 시간(2.5ms 대비 4.4ms)을 기록했다.
- DF1-Seg-d8 변종은 1/8 해상도에서 예측하고 이격자 인터폴레이션으로 업샘플링함으로써 1080Ti에서 136.9 FPS를 기록했고, 테스트 세트에서 mIoU 71.4%를 유지했다.
- DF2-Seg2는 56.3 FPS에서 Cityscapes 검증 세트에서 76.9%의 최고 mIoU를 기록하여 실시간 세그멘테이션 분야에서 새로운 최신 기술 수준을 설정했다.
- ICNet 대비 DF1-Seg는 유사한 추론 속도를 유지하면서 테스트 세트에서 mIoU가 3.5% 높았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.