Skip to main content
QUICK REVIEW

[논문 리뷰] Speeding Up EfficientNet: Selecting Update Blocks of Convolutional Neural Networks using Genetic Algorithm in Transfer Learning

Md. Mehedi Hasana, Muhammad Ibrahim|arXiv (Cornell University)|2023. 03. 01.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 전이 학습을 위한 EfficientNet에서 최적의 레이어 블록을 자동으로 선택하기 위해 유전 알고리즘을 제안한다. 이는 학습 시간을 단축시키면서도 정확도를 유지하거나 향상시킨다. 네트워크 블록을 최적화 단위로 간주하고 OTDD를 사용해 블록의 중요도를 측정함으로써, 표준 미세조정 대비 더 빠른 수렴과 더 적은 학습 가능한 파라미터를 달성한다.

ABSTRACT

The performance of convolutional neural networks (CNN) depends heavily on their architectures. Transfer learning performance of a CNN relies quite strongly on selection of its trainable layers. Selecting the most effective update layers for a certain target dataset often requires expert knowledge on CNN architecture which many practitioners do not posses. General users prefer to use an available architecture (e.g. GoogleNet, ResNet, EfficientNet etc.) that is developed by domain experts. With the ever-growing number of layers, it is increasingly becoming quite difficult and cumbersome to handpick the update layers. Therefore, in this paper we explore the application of genetic algorithm to mitigate this problem. The convolutional layers of popular pretrained networks are often grouped into modules that constitute their building blocks. We devise a genetic algorithm to select blocks of layers for updating the parameters. By experimenting with EfficientNetB0 pre-trained on ImageNet and using Food-101, CIFAR-100 and MangoLeafBD as target datasets, we show that our algorithm yields similar or better results than the baseline in terms of accuracy, and requires lower training and evaluation time due to learning less number of parameters. We also devise a metric called block importance to measure efficacy of each block as update block and analyze the importance of the blocks selected by our algorithm.

연구 동기 및 목표

  • 깊이 있는 네트워크인 EfficientNet과 같은 경우 전이 학습에서 효과적인 레이어를 수동으로 선택하는 데 도전하는 문제를 해결하기 위해.
  • 개별 레이어 대신 레이어 블록 전체를 선택하여 파rameter 업데이트에 활용함으로써 학습 시간과 계산 비용을 줄이기 위해.
  • CNN 아키텍처에 대한 전문 지식에 의존하지 않고도 선택 과정을 자동화하기 위해.
  • 특징 학습에 기여하는 정도를 평가하고 선택을 이끌기 위해 OTDD(최적 운반 데이터 거리) 기반의 블록 중요도 메트릭을 도입하기 위해.
  • Food-101, CIFAR-100, MangoLeafBD와 같은 다양한 데이터셋에서의 블록 수준 선택의 효과를 입증하기 위해.

제안 방법

  • 이 방법은 EfficientNetB0에서 미세조정할 블록 조합의 집단을 진화시키는 유전 알고리즘을 사용한다. 각 개체는 EfficientNetB0에서 미세조정할 블록 집합을 나타낸다.
  • 각 염색체는 전이 학습 중에 파라미터 업데이트에 대상이 되는 블록를 나타내는 이진 벡터로 인코딩된다.
  • 적합도는 타깃 데이터셋에서 학습 후 검증 정확도를 기반으로 평가되며, 계산을 줄이기 위해 조기 정지 기법이 적용된다.
  • 알고리즘은 최적 운반 데이터 거리(OTDD)에서 유도된 블록 중요도 메트릭을 포함하여, 각 블록의 특징 학습 기여도를 평가한다.
  • EfficientNet의 아키텍처 구조에 따라 블록을 그룹화하며, 잔여 블록을 선택의 원자 단위로 간주한다.
  • 이 접근법은 ImageNet으로 사전 훈련된 EfficientNetB0를 기반 모델로 사용하여, Food-101, CIFAR-100, MangoLeafBD 세 가지 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1유전 알고리즘이 EfficientNet의 레이어 블록을 효과적으로 선택하여 전이 학습 시 학습 시간을 단축시키면서 정확도를 훼손하지 않을 수 있는가?
  • RQ2블록 수준의 선택은 표준 레이어 수준의 미세조정 대비 정확도와 학습 효율성 측면에서 어떻게 비교되는가?
  • RQ3OTDD 기반의 블록 중요도 메트릭은 실제 전이 학습 성능과 어느 정도 상관관계를 가지는가?
  • RQ4제안된 방법은 복잡도와 도메인 특성이 다양한 다양한 데이터셋으로 일반화되는가?
  • RQ5선택된 블록들이 위치와 중요도 점수에 기반해 의미 있는 특징 학습 역할을 수행하는 것으로 해석될 수 있는가?

주요 결과

  • 제안된 유전 알고리즘은 Food-101, CIFAR-100, MangoLeafBD 세 타깃 데이터셋에서 표준 미세조정과 비교해 유사하거나 높은 정확도를 달성했다.
  • 학습 가능한 파라미터 수를 크게 줄여 학습 및 평가 시간을 단축시켰다.
  • OTDD 기반의 블록 중요도 메트릭은 고성능 블록을 성공적으로 식별했으며, 선택된 블록은 성능 향상과 강한 상관관계를 보였다.
  • EfficientNetB0의 중간 및 후반 단계 블록이 일관되게 업데이트 대상으로 선택되었으며, 이는 타깃 작업에 대한 분류 가능한 특징을 학습하는 데 기여하는 것으로 나타났다.
  • 이 알고리즘은 다양한 이미지 복잡도와 클래스 분포를 가진 데이터셋 간에 뛰어난 강인성을 보였으며, 일반화 가능성을 시사했다.
  • 블록 수준의 선택 접근법은 전체 네트워크의 약 30–50%의 블록에만 업데이트를 집중시켜 계산 오버헤드를 줄였으며, 성능 저하 없이도 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.