Skip to main content
QUICK REVIEW

[논문 리뷰] ScaleNAS: One-Shot Learning of Scale-Aware Representations for Visual Recognition

Hsin-Pai Cheng, Feng Liang|arXiv (Cornell University)|2020. 11. 30.
Human Pose and Action Recognition참고 문헌 35인용 수 6
한 줄 요약

ScaleNAS는 재학습이 필요 없이 다중 해상도, 고해상도 신경망 아키텍처를 효율적으로 탐색할 수 있도록 하는 one-shot 신경망 아키텍처 탐색 방법을 제안한다. 이는 시각 인식에서 스케일 인식 표현을 학습하는 데에 사용되며, 기존 방법보다 뛰어난 정확도와 낮은 계산 비용으로 인간 자세 추정(71.6% AP on COCO)과 세분화 분류에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Scale variance among different sizes of body parts and objects is a challenging problem for visual recognition tasks. Existing works usually design dedicated backbone or apply Neural architecture Search(NAS) for each task to tackle this challenge. However, existing works impose significant limitations on the design or search space. To solve these problems, we present ScaleNAS, a one-shot learning method for exploring scale-aware representations. ScaleNAS solves multiple tasks at a time by searching multi-scale feature aggregation. ScaleNAS adopts a flexible search space that allows an arbitrary number of blocks and cross-scale feature fusions. To cope with the high search cost incurred by the flexible space, ScaleNAS employs one-shot learning for multi-scale supernet driven by grouped sampling and evolutionary search. Without further retraining, ScaleNet can be directly deployed for different visual recognition tasks with superior performance. We use ScaleNAS to create high-resolution models for two different tasks, ScaleNet-P for human pose estimation and ScaleNet-S for semantic segmentation. ScaleNet-P and ScaleNet-S outperform existing manually crafted and NAS-based methods in both tasks. When applying ScaleNet-P to bottom-up human pose estimation, it surpasses the state-of-the-art HigherHRNet. In particular, ScaleNet-P4 achieves 71.6% AP on COCO test-dev, achieving new state-of-the-art result.

연구 동기 및 목표

  • 인간 자세 추정 및 세분화 분야와 같은 시각 인식 작업에서의 스케일 변동성 문제를 해결하기 위해.
  • 기존 NAS 및 수작업 설계 아키텍처의 높은 탐색 비용과 제한된 설계 유연성 문제를 극복하기 위해.
  • 재학습 없이 동시에 여러 성능이 뛰어난 아키텍처를 탐색할 수 있는 one-shot 학습 프레임워크를 개발하기 위해.
  • 다양한 하드웨어 플랫폼과 작업 요구사항에 직접 적용 가능한 효율적이고 스케일 인식 가능한 모델을 가능하게 하기 위해.

제안 방법

  • 임의의 블록 수와 크로스 스케일 특징 융합을 지원하는 유연한 다중 해상도 특징 융합 탐색 공간을 제안한다.
  • 다중 해상도 슈퍼넷을 효율적으로 훈련하기 위해 그룹화된 샘플링 전략을 도입하여 탐색 비용을 O(1)로 감소시킨다.
  • 다양한 아키텍처 토폴로지 탐색을 위해 내부 스테이지 크로스오버 및 변이를 포함한 진화적 탐색 알고리즘을 도입한다.
  • 지식 증착을 통한 one-shot 훈련을 활용하여 슈퍼넷의 성능을 우수한 하위망으로 전이한다.
  • ImageNet에서 훈련된 슈퍼넷을 도입하고, 도메인 특화 데이터셋(Cityscapes, COCO)에서 미세조정하여 우수한 아키텍처의 직접 배포를 가능하게 한다.
  • MSE 손실과 Cityscapes 사전 훈련된 교사 모델을 활용한 지식 증착을 적용하여 추가 훈련 없이도 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1one-shot NAS 프레임워크는 다양한 시각 인식 작업에서 스케일 인식 표현을 효과적으로 탐색할 수 있는가?
  • RQ2크로스 스케일 융합과 가변 깊이를 지원하는 다중 해상도 탐색 공간은 고해상도 작업에서 성능을 어떻게 향상시키는가?
  • RQ3그룹화된 샘플링과 진화적 탐색은 높은 정확도를 유지하면서 탐색 비용을 얼마나 줄일 수 있는가?
  • RQ4우수한 모델의 아키텍처 패턴은 블록 수, 융합 연산, FLOPs 간의 트레이드오프 측면에서 어떻게 나타나는가?

주요 결과

  • ScaleNet-P4는 COCO test-dev에서 71.6% AP를 기록하여 다인용 인간 자세 추정 분야에서 새로운 최신 기술 수준을 수립했다.
  • ScaleNet-S1은 Cityscapes 검증 세트에서 HRNet, Auto-DeepLab, 동적 라우팅보다 1.3%~1.7% 높은 mIoU 성능을 보였으며, FLOPs가 더 낮았다.
  • 그룹화된 샘플링에서 유도된 파레토 프론트는 랜덤 탐색과 샌드위치 규칙 모두를 뛰어넘는 아키텍처 탐색 효율성과 정확도를 보였다.
  • 더 큰 우수한 모델은 잔차 블록 수의 두 배에 해당하는 특징 융합 연산을 요구하며, 깊이 있는 모델에서 설계 우선순위가 블록에서 융합으로 이동하고 있음을 시사한다.
  • 지식 증착은 정확도를 약간 향상시켰다(80.4% mIoU 대비 KD 없이 80.2%로, 이는 유의미한 향상이지만 성능 향상의 주요 원인은 아님을 시사함).
  • 분석 결과, 네트워크 후반 단계에서 특징 융합의 영향력이 초기 단계보다 더 크며, 이는 계층적 다중 해상도 융합을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.