Skip to main content
QUICK REVIEW

[논문 리뷰] FoodX-251: A Dataset for Fine-grained Food Classification

Parneet Kaur, Karan Sikka|arXiv (Cornell University)|2019. 07. 14.
Image Retrieval and Classification Techniques참고 문헌 24인용 수 65
한 줄 요약

이 논문은 FoodX-251을 소개합니다. 이는 251개의 세밀한 식품 카테고리와 158k장의 이미지를 포함하는 대규모 웹 수집 데이터셋이며, 검증 및 테스트 세트에 대해 인간 검증 라벨을 제공하고, ResNet-101을 이용한 기준선을 제시합니다.

ABSTRACT

Food classification is a challenging problem due to the large number of categories, high visual similarity between different foods, as well as the lack of datasets for training state-of-the-art deep models. Solving this problem will require advances in both computer vision models as well as datasets for evaluating these models. In this paper we focus on the second aspect and introduce FoodX-251, a dataset of 251 fine-grained food categories with 158k images collected from the web. We use 118k images as a training set and provide human verified labels for 40k images that can be used for validation and testing. In this work, we outline the procedure of creating this dataset and provide relevant baselines with deep learning models. The FoodX-251 dataset has been used for organizing iFood-2019 challenge in the Fine-Grained Visual Categorization workshop (FGVC6 at CVPR 2019) and is available for download.

연구 동기 및 목표

  • 대규모의 세밀한 식품 데이터셋이 식품 분류를 위한 딥러닝을 발전시키는 데 필요하다는 점을 제시합니다.
  • FoodX-251의 생성 및 정제 과정(웹에서 얻은 노이즈 처리 포함)을 설명합니다.
  • 도전적이고 다양한 식품 데이터셋에서 향후 방법의 벤치마크를 만들기 위해 기준선 결과를 제공합니다.

제안 방법

  • Food-101을 WordNet 형제 카테고리 확장 및 수동 필터링으로 251개의 세밀한 식품 클래스를 수집합니다.
  • 각 클래스에 대해 웹 이미지를 다운로드하고 중복 제거 및 노이즈 필터링(교차 도메인 및 교차 카테고리)을 적용합니다.
  • 클래스별 무작위 샘플에 대한 인간 검증을 통해 깨끗한 검증 및 테스트 분할을 생성합니다(12k val, 28k test; 40k은 검증 가능).
  • ILSofRC에서 영감을 얻은 간단한 평가 지표를 사용합니다: 상위-3 라벨 정확도, 예측 라벨이 지상 진실과 일치하면 오답 0, 아니면 1.
  • ResNet-101을 사용한 두 가지 파인튜닝 전략(마지막 층만 vs 모든 층)으로 기준 딥러닝 결과를 제공합니다.
  • FGVC식의 식품 인식 도전과제에 대해 추가 연구를 자극하기 위해 기준선 성능을 보여줍니다.

실험 결과

연구 질문

  • RQ1웹 소스에서 수집한 대규모의 세밀한 식품 데이터셋이 최신 딥러닝 모델의 학습을 지원할 수 있는가?
  • RQ2웹 소스 식품 이미지의 노이즈와 애매함이 라벨링 및 모델 성능에 어떤 영향을 미치는가?
  • RQ3FoodX-251에서 표준 아키텍처가 달성하는 기본 성능은 얼마이며, 파인튜닝 범위가 결과에 어떤 영향을 미치는가?

주요 결과

  • FoodX-251은 251개 클래스와 158k 이미지로 구성되며, 118k 학습, 12k 검증, 28k 테스트 이미지를 포함하고 있습니다; 40k 이미지는 인간 검증 라벨이 있습니다.
  • 기준선 ResNet-101 결과는 마지막 층 파인튜닝과 전체 네트워크 파인튜닝 사이의 차이가 크게 나타나며, 모든 층을 파인튜닝할 때 상위-3 오차가 0.37에서 0.17로 감소합니다.
  • 전체 네트워크 파인튜닝은 이 세밀한 작업에서 마지막 층 파인튜닝에 비해 현저한 성능 향상을 제공합니다.
  • 데이터셋은 CVPR 2019의 iFood-2019 FGVC 워크숍 도전과제(FGVC6)로 사용되었습니다.
  • FoodX-251은 다양한 요리 항목과 높은 클래스 간 내적 유사성으로 도전적인 벤치마크를 제공하며, 세밀한 식품 분류기 평가에 적합합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.