Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stage architectural fine-tuning with neural architecture search using early-stopping in image classification

Y. K. Kim, Won Joon Yun|arXiv (Cornell University)|2022. 02. 17.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 이미지 분류를 위한 신경망 아키텍처 탐색(NAS)과 전이 학습을 결합한 이단계적 아키텍처 미세조정 방법을 제안한다. 변형 기반 검색 공간 정의와 조기 정지 기법을 통해 계산 비용과 검색 비용을 감소시킨다. 제안된 방법은 기준선 대비 32.4%의 계산 비용 절감과 22.3%의 검색 비용 감소를 달성하면서 ResNet-18 및 ResNet-50 모델에서 정확도를 향상시킨다.

ABSTRACT

In many deep neural network (DNN) applications, the difficulty of gathering high-quality data in the industry field hinders the practical use of DNN. Thus, the concept of transfer learning has emerged, which leverages the pretrained knowledge of DNNs trained on large-scale datasets. Therefore, this paper suggests two-stage architectural fine-tuning, inspired by neural architecture search (NAS). One of main ideas is mutation, which reduces the search cost using given architectural information. Moreover, early-stopping is considered which cuts NAS costs by terminating the search process in advance. Experimental results verify our proposed method reduces 32.4% computational and 22.3% searching costs.

연구 동기 및 목표

  • 실제 산업 응용에서의 데이터 부족 문제를 해결하기 위해 이미지 분류를 위한 전이 학습을 향상시키기.
  • 실제 구현에서 신경망 아키텍처 탐색(NAS)과 관련된 높은 계산 비용과 검색 비용을 줄이기.
  • 작은 변형 기반 검색 공간을 사용해 아키텍처와 가중치를 동시에 미세조정함으로써 모델 성능을 향상시키기.
  • 컨트롤러의 동작 안정성에 기반해 보상 수렴 이전에 NAS를 종료하는 조기 정지 메커니즘 개발하기.
  • 다양한 검색 범위 설정에서 다양한 백본 아키텍처(예: ResNet-18 및 ResNet-50)에 대해 일반화 가능성 입증하기.

제안 방법

  • 기본 아키텍처(예: ResNet-18/50), 변형 규칙, 설정 가능한 검색 범위를 사용해 아키텍처 변형을 제한하는 컴팩트한 검색 공간 정의하기.
  • 강화학습(RL) 기반 컨트롤러를 사용해 검색 공간에서 서브넷을 샘플링하며, 동작은 필터 크기(3×3 또는 5×5)와 같은 아키텍처 선택을 나타냄.
  • 학습 중 후보 아키텍처의 효율적 평가를 위해 파라미터 공유를 사용하는 슈퍼넷 사용하기.
  • 컨트롤러의 동작 분포가 안정화되면 보상 수렴 이전이라도 검색을 중단하는 조기 정지 전략 구현하기.
  • 원본 데이터셋에서 사전 학습된 가중치를 사용해 검색을 초기화하며, 검색 범위가 가중치 재사용 범위를 제어함.
  • 일致한 비교를 위해 총 보상을 [0,1]로 정규화하고, 테스트 정확도를 RL 컨트롤러의 보상 신호로 사용하기.

실험 결과

연구 질문

  • RQ1변형 기반 검색 공간 정의가 이미지 분류에서 모델 성능을 유지하거나 향상시키면서 NAS의 검색 비용을 줄일 수 있는가?
  • RQ2동작 분포 안정성에 기반한 조기 정지 전략이 최종 정확도를 떨어뜨리지 않고 검색 시간과 계산 비용을 크게 감소시킬 수 있는가?
  • RQ3검색 범위가 아키텍처 미세조정 과정의 성능와 수렴에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 ResNet-18 및 ResNet-50와 같은 다양한 백본 아키텍처에 얼마나 일반화되는가?
  • RQ5제약된 검색 공간 내에서 사전 학습된 가중치를 사용할 경우, 표준 미세조정 대비 최종 모델 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 기준선 미세조정 방법 대비 계산 비용을 32.4% 감소시키고 검색 비용을 22.3% 감소시켰다.
  • 다양한 검색 범위에서의 모델 성능 순위는 전체 > 대규모 > 중간 > 소규모 순서로 나타나, 더 넓은 검색 범위가 더 나은 성능을 낸다는 것을 시사한다.
  • ResNet-18의 경우, 전체 검색 범위를 사용한 ENASResNet-18 모델은 최종 정확도 85.6%를 달성하여 베이직 ResNet-18보다 4.0% 높은 성능을 보였다.
  • 조기 정지 메커니즘이 동작 분포가 안정화된 순간(예: 중간 범위에서 ResNet-18의 경우 140개 서브넷 샘플링 단계)에 보상 수렴 이전에 검색을 종료함으로써 검색 시간을 효과적으로 단축시켰다.
  • 보상 수렴 이전에 동작 분포가 안정화됨을 확인하여, 조기 정지 전략이 효율적이고 효과적임을 입증했다.
  • ResNet-50의 경우 전체 및 대규모 검색 범위에서 성능가 거의 동일하여, 일정 수준 이상의 아키텍처 다양성은 성능 향상에 미미한 기여를 한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.