[논문 리뷰] FasterSeg: Searching for Faster Real-time Semantic Segmentation
FasterSeg은 실시간 의미 분할을 위해 다중 해상도 NAS를 자동으로 설계하여 Cityscapes에서 가장 가까운 수동 기준선보다 속도가 30% 이상 더 빠르면서도 경쟁력 있는 정확도를 유지합니다. 또한 디커플링 지연 정규화와 교사-학생 공동 탐색 확장을 도입합니다.
We present FasterSeg, an automatically designed semantic segmentation network with not only state-of-the-art performance but also faster speed than current methods. Utilizing neural architecture search (NAS), FasterSeg is discovered from a novel and broader search space integrating multi-resolution branches, that has been recently found to be vital in manually designed segmentation models. To better calibrate the balance between the goals of high accuracy and low latency, we propose a decoupled and fine-grained latency regularization, that effectively overcomes our observed phenomenons that the searched networks are prone to "collapsing" to low-latency yet poor-accuracy models. Moreover, we seamlessly extend FasterSeg to a new collaborative search (co-searching) framework, simultaneously searching for a teacher and a student network in the same single run. The teacher-student distillation further boosts the student model's accuracy. Experiments on popular segmentation benchmarks demonstrate the competency of FasterSeg. For example, FasterSeg can run over 30% faster than the closest manually designed competitor on Cityscapes, while maintaining comparable accuracy.
연구 동기 및 목표
- 실시간 의미 분할을 엄격한 지연 제약 하에서 동기부여한다.
- 핸드 크래프드 효율 모델에서 영감을 받은 다중 해상도 가지를 활용하는 NAS 프레임워크를 개발한다.
- NAS 탐색 중에 세밀한 지연 정규화를 통해 아키텍처 붕괴를 해결한다.
- 교사-학생 공동 탐색 프레임워크로 FasterSeg를 확장하여 학생의 정확도를 향상시킨다.
- Cityscapes에서 최첨단 속도와 경쟁력 있는 정확도를 달성하고 CamVid 및 BDD로의 전이성을 입증한다.
제안 방법
- 헤드 모듈에 의해 적응적으로 선택되고 집계될 수 있는 다중 해상도 가지를 갖는 새로운 탐색 공간을 제안한다.
- 더 큰 수용영역을 더 낮은 지연으로 달성하기 위한 확대(convolution) 변형(줌된 컨볼루션: 다운샘플 + conv + 업샘플)을 도입한다.
- 단일 연산자 내에서 확장 비를 탐색하기 위해 확장 비를 탐색하는 미분 가능 슈퍼커널을 사용한다.
- 알파(arch params), 베타, 감마를 학습 가능한 연산 공간의 연속 이완과 Gumbel-Softmax를 사용해 아키텍처를 샘플링한다.
- 연구 공간의 미세한 지연 정규화를 도입하여 연산자, 다운샘플링 비율, 확장 비 사이의 지연을 분리해 아키텍처 붕괴를 방지한다.
- 교사-학생 공동 탐색 프레임워크로 확장하여 한 실행에서 교사와 학생을 최적화하고 학습 중 증류하여 학생의 정확도를 향상시킨다.
- 배운 확률에서 최적의 연산자와 확장 비를 선택하고 학습된 확률로 가지의 다운샘플 위치를 결정하여 이산 아키텍처를 도출한다.
실험 결과
연구 질문
- RQ1다중 해상도 NAS 탐색 공간이 가지 다양성을 활용하여 실시간 분할을 개선할 수 있는가?
- RQ2세밀한 지연 정규화가 지연 제약 NAS 탐색 중 아키텍처 붕괴를 완화시키는가?
- RQ3NAS 내에서 교사-학생 공동 탐색이 지연을 늘리지 않고 경량 학생 네트워크의 정확도를 개선하는가?
- RQ4기 업 FasterSeg가 표준 실시간 분할 벤치마크에서 수동으로 설계된 아키텍처와 비교하여 어떤 성과를 보이는가?
- RQ5FasterSeg 디자인이 Cityscapes, CamVid, BDD 간에 데이터 증강 없이도 전이 가능하는가?
주요 결과
- FasterSeg는 163.9 FPS에서 Cityscapes val에 대해 73.1% mIoU를 달성하며, 1024 × 2048 해상도에서 여러 수동 아키텍처보다 속도 측면에서 우수하면서도 경쟁력 있는 정확도를 유지한다.
- 적응형 가지 집계가 있는 다중 해상도 탐색 공간은 실시간 분할에 효과적이며 확장 비 탐색(χ)은 정확도를 희생하지 않으면서 더 빠른 모델을 낳는다.
- 미세한 지연 정규화는 아키텍처 붕괴를 성공적으로 해결하여 탐색을 속도와 정확도 목표에 맞춘다.
- 교사-학생 공동 탐색은 증류 기반 지식 이전보다 더 높은 정확도의 학생(73.1% mIoU)을 얻어 NAS 탐색과 지식 전달의 결합 이점을 보여준다.
- Cityscapes에서 FasterSeg는 FPS(163.9)에서 여러 베이스라인을 능가하고 경쟁력 있는 mIoU(73.1%)를 달성하며 CamVid(398.1 FPS) 및 BDD(318.0 FPS)로의 전이성을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.