[논문 리뷰] An evaluation of pre-trained models for feature extraction in image classification
이 논문은 4개의 이미지 데이터셋에서 16개의 사전 학습 모델을 피처 추출기로 체계적으로 평가하고, 트랜스포머 기반 모델(특히 CLIP-ViT-B, CLIP-ResNet50, 및 VisionTransformer-H/14)이 일반적으로 CNN만 아키텍처보다 더 우수하다고 결론내립니다.
In recent years, we have witnessed a considerable increase in performance in image classification tasks. This performance improvement is mainly due to the adoption of deep learning techniques. Generally, deep learning techniques demand a large set of annotated data, making it a challenge when applying it to small datasets. In this scenario, transfer learning strategies have become a promising alternative to overcome these issues. This work aims to compare the performance of different pre-trained neural networks for feature extraction in image classification tasks. We evaluated 16 different pre-trained models in four image datasets. Our results demonstrate that the best general performance along the datasets was achieved by CLIP-ViT-B and ViT-H-14, where the CLIP-ResNet50 model had similar performance but with less variability. Therefore, our study provides evidence supporting the choice of models for feature extraction in image classification tasks.
연구 동기 및 목표
- 레이블된 데이터가 제한된 경우 이미지 분류를 위한 전이 학습의 동기를 제시한다.
- 다양한 데이터셋에서 고정 특성 추출기로서의 다수의 사전 학습 모델을 비교한다.
- FE 작업에서 최상의 일반 성능을 제공하는 아키텍처(CNN vs. 트랜스포머 기반)을 식별한다.
- 이미지 분류 작업에서 피처 추출에 대한 모델 선택에 대한 지침을 제공한다.
제안 방법
- 사전 학습된 백본 네트워크를 동결하고 최종 분류기를 데이터셋 클래스 수에 맞춘 새 출력 계층으로 교체한다.
- 일관된 전처리(리사이즈, 센터 크롭, RGB 변환)를 적용하고 5-fold 교차 검증 설정으로 학습한다.
- 학습률 0.001, 모멘텀 0.9, Adam 옵티마이저, Cross-Entropy 손실로 최대 100 에포크까지 조기 중단과 함께 학습한다.
- 각 폴드에서 정확도, 매크로 F1, 가중치 F1으로 평가한다.
![Figure 1: Illustration of the imbalance in the number of images for each class on the Geological Images dataset [ 9 ] .](https://ar5iv.labs.arxiv.org/html/2310.02037/assets/geo.png)
실험 결과
연구 질문
- RQ1선택된 데이터셋 전반에서 고정 피처 추출기로 사용할 때 어떤 사전 학습 모델이 가장 높은 정확도와 F1 지표를 산출하는가?
- RQ2CNN 기반 아키텍처와 트랜스포머 기반 아키텍처의 피처 추출 성능과 변동성은 어떻게 비교되는가?
- RQ3더 많은 클래스나 이질적인 이미지 크기를 가진 특정 데이터셋이 다른 사전 학습 모델의 상대적 효과에 영향을 주는가?
- RQ4데이터셋과 지표 간의 성능 상호 모델 간 상관관계에서 어떤 패턴이 나타나는가?
주요 결과
- 트랜스포머 기반 모델(CLIP-ViT-B, CLIP-ResNet50, VisionTransformer-H/14)은 일반적으로 모든 데이터셋에서 CNN 기반 모델보다 우수하다.
- Geological Images에서 CLIP-ViT-B가 가장 높은 정확도와 매크로 및 가중 지표에서 근소한 최상위 점수를 달성한다.
- CIFAR-10에서 ViT-H/14가 가장 높은 정확도(~0.98)에 도달하고, CLIP-ViT-B와 ConvNeXt-L도 강한 성능을 보인다.
- STL10에서 ViT-H/14와 ConvNeXt-L이 최고 정확도에 도달한다(~1.00 및 ~0.99).
- CNN만 있는 아키텍처는 성능이 더 약하고 변동성이 크며, AlexNet은 모든 데이터셋에서 일관되게 성능이 낮다.
- 상관관계 분석은 CNN 기반 모델이 상호 모델 간 유사성이 높은 군으로 군집하는 반면, 트랜스포머 기반 모델(CLIP 변형 및 Vision Transformer)은 별도의 성능 그룹을 형성한다.
![Figure 2: Examples of images included in the Geological Images dataset [ 9 ] .](https://ar5iv.labs.arxiv.org/html/2310.02037/assets/geoEx.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.