Skip to main content
QUICK REVIEW

[논문 리뷰] FBNetV5: Neural Architecture Search for Multiple Tasks in One Run

BoRui Wu, Chaojian Li|arXiv (Cornell University)|2021. 11. 19.
Advanced Neural Network Applications참고 문헌 63인용 수 12
한 줄 요약

FBNetV5는 단일 검색 런에서 동시에 여러 컴퓨터 비전 작업—이미지 분류, 객체 검출, 세그멘테이션—을 위한 효율적이고 고성능 모델을 동시에 탐색하는 신경망 아키텍처 탐색 프레임워크이다. 통합된 다중 해상도 슈퍼넷과 학습 가능한 이진 마스크, 그리고 다중 작업 프oxy 학습 목표를 사용하여, 검색 비용을 크게 줄이고 작업별 파ipel라인 통합이 필요 없이 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Neural Architecture Search (NAS) has been widely adopted to design accurate and efficient image classification models. However, applying NAS to a new computer vision task still requires a huge amount of effort. This is because 1) previous NAS research has been over-prioritized on image classification while largely ignoring other tasks; 2) many NAS works focus on optimizing task-specific components that cannot be favorably transferred to other tasks; and 3) existing NAS methods are typically designed to be "proxyless" and require significant effort to be integrated with each new task's training pipelines. To tackle these challenges, we propose FBNetV5, a NAS framework that can search for neural architectures for a variety of vision tasks with much reduced computational cost and human effort. Specifically, we design 1) a search space that is simple yet inclusive and transferable; 2) a multitask search process that is disentangled with target tasks' training pipeline; and 3) an algorithm to simultaneously search for architectures for multiple tasks with a computational cost agnostic to the number of tasks. We evaluate the proposed FBNetV5 targeting three fundamental vision tasks -- image classification, object detection, and semantic segmentation. Models searched by FBNetV5 in a single run of search have outperformed the previous stateof-the-art in all the three tasks: image classification (e.g., +1.3% ImageNet top-1 accuracy under the same FLOPs as compared to FBNetV3), semantic segmentation (e.g., +1.8% higher ADE20K val. mIoU than SegFormer with 3.6x fewer FLOPs), and object detection (e.g., +1.1% COCO val. mAP with 1.2x fewer FLOPs as compared to YOLOX).

연구 동기 및 목표

  • 이미지 분류를 초월한 새로운 컴퓨터 비전 작업에 NAS를 적용할 때 발생하는 높은 인간적 및 계산 비용을 해결하기 위해.
  • 다른 비전 작업 간에 전이되지 않는 작업별 특화 NAS 방법의 한계를 극복하기 위해.
  • NAS 검색 과정을 타겟 작업 학습 파이프라인에서 분리하여 확장성과 재사용성을 향상시키기 위해.
  • 검색 비용이 작업 수에 따라 변하지 않는 검색 알고리즘 개발을 통해 효율적인 다중 작업 아키텍처 탐색을 가능하게 하기 위해.
  • 작업별 재조정 없이도 다양한 비전 작업에서 최신 기술 수준의 모델을 단일 검색 런으로 도출할 수 있음을 입증하기 위해.

제안 방법

  • HRNet에서 영감을 얻어 병렬 경로를 가진 다중 해상도 슈퍼넷을 기반으로 단순하면서도 포괄적이고 이식 가능한 검색 공간을 설계한다.
  • 슈퍼넷 내에서 아키텍처 선택(유지/제거 블록)을 표현하기 위해 학습 가능한 이진 마스크를 활용하여 미분 가능 아키텍처 탐색을 가능하게 한다.
  • 사전 학습된 모델로부터 유도된 합성 검출 및 세그멘테이션 레이블을 포함한 ImageNet에서 파생된 프록시 다중 작업 데이터셋을 사용하여 검색을 수행한다.
  • 단일 슈퍼넷을 동시에 여러 작업을 최적화하도록 훈련시키는 새로운 다중 작업 검색 알고리즘(알고리즘 4)을 도입하며, 검색 비용이 작업 수에 따라 독립적이다.
  • 하류 학습에 영향을 주지 않도록 고정된 프록시 데이터셋과 손실을 사용하여 검색 과정을 타겟 작업 학습 파이프라인에서 분리한다.
  • 모든 작업 간에 공유되는 슈퍼넷과 공유 파라미터를 사용하여, 한 번의 훈련 런으로 여러 목표를 동시에 효율적으로 아키텍처 탐색할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1일관된 파이프라인 통합 없이도 단일 NAS 프레임워크가 여러 비전 작업에 대해 동시에 고성능·효율적인 아키텍처를 탐색할 수 있는가?
  • RQ2다중 해상도 경로와 공유 파라미터를 가진 통합 검색 공간이 분류, 검출, 세그멘테이션과 같은 다양한 작업 간에 이식 가능하고 효과적인 아키텍처를 가능하게 하는가?
  • RQ3다중 작업 검색 알고리즘이 단일 작업 검색과 비교해 성능을 유사하거나 향상시키면서도, 작업 수에 비례하는 비율로 검색 비용을 줄일 수 있는가?
  • RQ4공동 검색을 통해 탐색된 모델의 성능은 정확도, FLOPs, 추론 효율성 측면에서 다양한 벤치마크에서 최신 기술 수준의 모델과 비교해 어떻게 되는가?
  • RQ5제안된 프레임워크는 재학습이나 검색 파이프라인 재구성 없이도 새로운 작업에 대해 확장 가능한 NAS를 가능하게 하는가?

주요 결과

  • 동일한 FLOPs 조건에서 FBNetV5는 FBNetV3보다 ImageNet 분류에서 1.3% 높은 정확도를 달성하여, 더 나은 효율-정확도 트레이드오프를 입증한다.
  • ADE20K에서의 세그멘테이션 작업에서 FBNetV5는 SegFormer보다 mIoU가 1.8% 높지만 FLOPs는 3.6배 적게 사용하여 뚜렷한 효율성 향상을 보였다.
  • COCO에서의 객체 검출 작업에서 FBNetV5는 YOLOX보다 mAP를 1.1% 향상시키며 FLOPs는 1.2배 감소시켜 낮은 계산량으로도 뛰어난 성능을 보였다.
  • 다중 작업 검색 알고리즘은 단일 작업 검색 대비 검색 비용을 T(작업 수) 배 감소시켰으며, 성능은 유지하거나 향상시켰다.
  • 분류 작업을 위한 탐색된 아키텍처는 순차적이지 않은 다중 해상도 블록 패턴을 보이며, 기존의 순차적 스택 구조를 넘어서는 새로운 설계 방향을 시사한다.
  • 동일한 검색 공간에서의 무작위 검색도 강력한 베이스라인 성능을 보였지만, FBNetV5의 다중 작업 검색은 모든 작업에서 0.3–1.6%p 범위로 일관되게 뛰어난 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.