[논문 리뷰] Efficient Neural Architecture Transformation Searchin Channel-Level for Object Detection
이 논문은 이질성 컨볼루션을 사용하여 채널 수준의 변환을 탐색함으로써 사전 훈련된 이미지 분류 네트워크를 객체 검출에 적응시키는 그래디언트 기반 신경망 아키텍처 변환 검색 방법인 NATS를 제안한다. 검색 및 재훈련 단계에서 ImageNet 사전 훈련된 가중치를 재사용함으로써 NATS는 추가 파rameter나 FLOPs 없이 COCO에서 최대 2.0%의 AP 향상을 달성하며, 실시간 검출 시스템에서 효율적이고 하드웨어 우수한 구현을 가능하게 한다.
Recently, Neural Architecture Search has achieved great success in large-scale image classification. In contrast, there have been limited works focusing on architecture search for object detection, mainly because the costly ImageNet pre-training is always required for detectors. Training from scratch, as a substitute, demands more epochs to converge and brings no computation saving. To overcome this obstacle, we introduce a practical neural architecture transformation search(NATS)algorithm for object detection in this paper. Instead of searching and constructing an entire network, NATS explores the architecture space on the base of existing network and reusing its weights. We propose a novel neural architecture search strategy in channel-level instead of path-level and devise a search space specially targeting at object detection. With the combination of these two designs, an architecture transformation scheme could be discovered to adapt a network designed for image classification to task of object detection. Since our method is gradient-based and only searches for a transformation scheme, the weights of models pretrained inImageNet could be utilized in both searching and retraining stage, which makes the whole process very efficient. The transformed network requires no extra parameters and FLOPs, and is friendly to hardware optimization, which is practical to use in real-time application. In experiments, we demonstrate the effectiveness of NATSon networks like ResNet and ResNeXt. Our transformed networks, combined with various detection frameworks, achieve significant improvements on the COCO dataset while keeping fast.
연구 동기 및 목표
- 사전 훈련 없이 객체 검출기 모델을 처음부터 훈련하거나 큰 백본을 미세조정할 때 발생하는 비효율성을 해결하기 위해.
- 이미지 분류와 객체 검출 간 격차를 해소하기 위해 작업에 특화된 아키텍처 검색 공간을 설계하기 위해.
- 검색 및 재훈련 단계 모두에서 ImageNet 사전 훈련된 가중치를 재사용함으로써 추가 파rameter 없이 그래디언트 기반의 효율적인 아키텍처 검색을 가능하게 하기 위해.
- 추가 파arameter나 FLOPs 없이 기존 백본을 변형함으로써 COCO에서의 객체 검출 성능을 향상시키기 위해.
- 채널 수준의 연산과 확장 패tern에 집중하는 검색 전략을 개발하여 다중 척도 객체 검출을 위한 효과적이고 확장 가능한 수용 영역을 향상시키기 위해.
제안 방법
- 각 경로의 특징 맵을 채널 단위의 부분 경로로 분할하고, 이를 각각 검색 가능한 단위로 간주하는 채널 수준의 검색 전략을 제안한다.
- 핵심 크기를 유지한 채 효과적 수용 영역를 확장하기 위해 다수의 확장 비율을 가진 이질성 컨볼루션을 기반으로 한 검색 공간을 설계한다.
- 기존 네트워크 구조를 재구성하는 최적의 변환 방식을 발견하기 위해 미분 가능하고 그래디언트 기반의 검색을 사용한다.
- 검색 및 재훈련 단계 모두에서 ImageNet 사전 훈련된 가중치를 재사용함으로써, 고비용의 사전 훈련이나 추가 파arameter가 필요 없도록 한다.
- 학습된 변환 방식을 ResNet 및 ResNeXt와 같은 기존 백본에 적용하여, 최소한의 계산 부담으로 객체 검출에 적합하게 조정한다.
- 채널 기반 특징 흐름의 구조적 변화에 중점을 두어 고성능 구성의 효율적 탐색을 가능하게 하는 검색 전략을 구현한다.
실험 결과
연구 질문
- RQ1사전 훈련된 이미지 분류 네트워크를 처음부터 훈련하지 않고도 효율적으로 객체 검출에 적응시킬 수 있는 그래디언트 기반 아키텍처 검색 방법을 설계할 수 있는가?
- RQ2객체 검출의 요구사항, 특히 다중 척도 객체 변동을 다루는 데에 더 적합하도록 검색 공간을 재정의할 수 있는가?
- RQ3확장 연산을 통한 효과적 수용 영역(ERF) 확장을 통해 검출 성능 향상 정도는 어느 정도일 수 있는가?
- RQ4파arameter나 FLOPs 없이도 변환 기반 접근 방식이 상당한 성능 향상을 달성할 수 있는가?
- RQ5학습된 아키텍처 변환 전략은 다양한 검출 프레임워크와 백본 깊이에 대해 얼마나 일반화 가능한가?
주요 결과
- NATS는 ResNet-50 기반 Faster R-CNN에서 COCO에서 2.0% AP 향상을 달성했고, ResNet-101 기반 모델에선 1.8% AP 향상을 기록했으며, 추가 파arameter나 FLOPs 없이 수행되었다.
- 동일한 변환된 백본을 사용하여 Mask R-CNN에선 1.9% AP 향상, Cascade R-CNN에선 1.3% AP 향상, RetinaNet에선 1.3% AP 향상이 이루어졌다.
- 검색 과정은 8× 1080Ti GPU에서 약 2.5일이 소요되었고, 재훈련은 단 1일이면 완료되어 기준 모델 훈련 수준과 유사했다.
- 변환된 네트워크는 더 크고 더 강력한 효과적 수용 영역(ERF)을 보였으며, 중심 강도가 높고 외곽 영역의 커버리지가 우수했다.
- 더 깊은 모델로의 일반화 성능도 우수했으며, ResNeXt-101에선 1.1% AP 향상이 있었고, 더 깊은 네트워크일수록 대형 객체 AP(AP_L) 향상도 더 두드러졌다.
- 다양한 종횡비를 가진 확장 후보들((1,3), (3,1) 등)이 균일한 후보들보다 0.4% 성능 향상을 보였으며, 이는 ERF 다양성의 중요성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.