Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Tuning VGG Neural Network For Fine-grained State Recognition of Food Images

Kaoutar Ben Ahmed, Ahmad Babaeian Jelodar|arXiv (Cornell University)|2018. 09. 08.
Advanced Chemical Sensor Technologies참고 문헌 15인용 수 5
한 줄 요약

이 논문은 7개의 식품 카테고리에 걸쳐 총 5,978장의 이미지로 구성된 소규모 수동 주석 처리 데이터셋을 사용하여 사전 훈련된 VGG 신경망을 미세조정하여 세분화된 식품 상태 인식을 위한 방법을 제안한다. 전이 학습과 데이터 증강 기법을 활용함으로써 훈련 데이터가 제한된 상황에서도 높은 정확도를 달성하였으며, 이는 CNN 모델이 세분화된 식품 상태 분류 과제에서 효과적임을 보여준다.

ABSTRACT

State recognition of food images can be considered as one of the promising applications of object recognition and fine-grained image classification in computer vision. In this paper, evidence is provided for the power of convolutional neural network (CNN) for food state recognition, even with a small data set. In this study, we fine-tuned a CNN initially trained on a large natural image recognition dataset (Imagenet ILSVRC) and transferred the learned feature representations to the food state recognition task. A small-scale dataset consisting of 5978 images of seven categories was constructed and annotated manually. Data augmentation was applied to increase the size of the data.

연구 동기 및 목표

  • 제한된 주석 처리 데이터를 사용한 세분화된 식품 상태 인식 과제를 해결하기 위해.
  • 사전 훈련된 CNN 모델을 사용한 전이 학습의 효과를 식품 이미지 분류 과제에서 평가하기 위해.
  • 7개 카테고리에 걸쳐 총 5,978장의 이미지로 구성된 소규모이면서 고품질의 데이터셋을 구축하고 주석 처리하기 위해.
  • 데이터 증강 및 VGG 네트워크의 미세조정을 통해 분류 성능을 향상시키기 위해.

제안 방법

  • ImageNet ILSVRC에서 사전 훈련된 VGG 신경망을 식품 상태 인식 과제에 대해 미세조정하기 위해 사용한다.
  • ImageNet에서 학습된 특징 표현을 식품 상태 분류 과제로 전이한다.
  • 7개 카테고리에 걸쳐 총 5,978장의 수동 주석 처리된 식품 이미지로 구성된 맞춤형 데이터셋을 구축한다.
  • 훈련 데이터의 다양성과 모델의 일반화 능력을 향상시키기 위해 데이터 증강 기법을 적용한다.
  • 최종 분류 레이어를 교체한 후 식품 데이터셋에서 네트워크를 엔드 투 엔드로 훈련한다.
  • 테스트 세트에서 정확도와 같은 표준 지표를 사용하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1제한된 훈련 데이터로 사전 훈련된 VGG 네트워크가 세분화된 식품 상태 인식에서 높은 성능을 달성할 수 있는가?
  • RQ2ImageNet에서의 전이 학습이 식품 상태의 미세한 차이를 분류하는 데 얼마나 효과적인가?
  • RQ3데이터 증강이 소규모 식품 이미지 데이터셋에서 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ4CNN의 미세조정이 식품 상태 분류 성능에 어떤 영향을 미치는가?
  • RQ5제안된 데이터셋의 7개의 서로 다른 식품 카테고리에서 모델의 성능은 어떠한가?

주요 결과

  • 제한된 훈련 샘플에도 불구하고, 미세조정된 VGG 모델은 소규모 식품 상태 데이터셋에서 높은 분류 정확도를 달성하였다.
  • ImageNet에서의 전이 학습은 초기 학습부터 시작하는 것보다 성능 향상에 크게 기여하였다.
  • 데이터 증강은 훈련 데이터의 다양성을 효과적으로 증가시키고 모델의 강인성을 향상시켰다.
  • 주석 처리된 데이터셋의 모든 7개 식품 카테고리에서 모델은 뛰어난 일반화 능력을 보였다.
  • 이 연구는 소규모이면서 철저히 캐릭터화된 데이터셋을 활용한 전이 학습을 통해 세분화된 식품 상태 인식이 가능하다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.