Skip to main content
QUICK REVIEW

[논문 리뷰] ISIA Food-500: A Dataset for Large-Scale Food Recognition via Stacked Global-Local Attention Network

Weiqing Min, Linhu Liu|arXiv (Cornell University)|2020. 08. 13.
Nutritional Studies and Diet참고 문헌 56인용 수 15
한 줄 요약

이 논문은 500개의 카테고리와 399,726장의 이미지를 포함하는 대규모 식품 인식 데이터셋인 ISIA Food-500을 소개하고, 하이브리드 공간-채널 주의 및 계층적 공간 변환기를 통해 보완적인 전반적 및 국소적 특징을 동시에 학습하는 스택형 글로벌-로컬 주의 네트워크(SGLANet)를 제안한다. SGLANet는 ISIA Food-500에서 최고 성능을 기록하며, ETHZ Food-101과 Vireo Food-172와 같은 일반화된 데이터셋으로도 잘 일반화되어, 대규모 식품 인식에서 뛰어난 전이 가능성과 강건성을 입증한다.

ABSTRACT

Food recognition has received more and more attention in the multimedia community for its various real-world applications, such as diet management and self-service restaurants. A large-scale ontology of food images is urgently needed for developing advanced large-scale food recognition algorithms, as well as for providing the benchmark dataset for such algorithms. To encourage further progress in food recognition, we introduce the dataset ISIA Food- 500 with 500 categories from the list in the Wikipedia and 399,726 images, a more comprehensive food dataset that surpasses existing popular benchmark datasets by category coverage and data volume. Furthermore, we propose a stacked global-local attention network, which consists of two sub-networks for food recognition. One subnetwork first utilizes hybrid spatial-channel attention to extract more discriminative features, and then aggregates these multi-scale discriminative features from multiple layers into global-level representation (e.g., texture and shape information about food). The other one generates attentional regions (e.g., ingredient relevant regions) from different regions via cascaded spatial transformers, and further aggregates these multi-scale regional features from different layers into local-level representation. These two types of features are finally fused as comprehensive representation for food recognition. Extensive experiments on ISIA Food-500 and other two popular benchmark datasets demonstrate the effectiveness of our proposed method, and thus can be considered as one strong baseline. The dataset, code and models can be found at http://123.57.42.89/FoodComputing-Dataset/ISIA-Food500.html.

연구 동기 및 목표

  • 딥 러닝 모델을 위한 식품 인식 분야에서 대규모, 다양한, 종합적인 식품 데이터셋의 부족을 해결하기 위해.
  • 식품 이미지의 높은 내부 클래스 변동성과 미세한 구분 특징을 극복하기 위해 새로운 딥 러닝 아키텍처를 제안하기 위해.
  • 식품 인식 성능 향상을 위해 전반적 수준(질감, 형태)과 국소적 수준(성분 관련 영역)의 시각적 특징을 효과적으로 포괄하는 통합 모델을 개발하기 위해.
  • ISIA Food-500과 기준 데이터셋에서의 훈련 및 평가를 통해 대규모 식품 인식의 강력한 기준 모델을 수립하기 위해.
  • ISIA Food-500에서 사전 훈련된 모델이 다른 기존 식품 인식 기준 데이터셋으로의 일반화 능력을 입증하기 위해.

제안 방법

  • 제안된 SGLANet는 두 개의 서브넷으로 구성된다: 하이브리드 공간-채널 주의를 사용해 구분 능력 있는 특징을 추출하고, 계층 간 특징을 집계하여 전반적 표현을 생성하는 전반적 특징 학습 서브넷(GloFLS).
  • 국소적 특징 학습 서브넷(LocFLS)은 계층적 공간 변환기를 활용해 주의 영역을 국소화하고, 다중 해상도의 지역적 특징을 집계하여 국소적 표현을 생성한다.
  • 전반적 및 국소적 특징을 융합하여 최종 분류를 위한 종합적 표현을 형성한다.
  • 전반적 및 국소적 특징 간 보완 효과를 극대화하기 위해 다중 손실 함수를 사용해 엔드 투 엔드로 네트워크를 훈련시킨다.
  • ISIA Food-500에서의 사전 훈련을 통해 전이 학습이 가능해져, ETHZ Food-101 및 Vireo Food-172와 같은 후행 기준 데이터셋에서 성능 향상을 이룬다.
  • 정확도와 일반화 능력을 평가하기 위해 1-크롭 및 10-크롭 테스트 설정에서 모델을 평가한다.

실험 결과

연구 질문

  • RQ1500개의 카테고리와 399,726장 이상의 이미지를 포함하는 대규모이고 다양한 식품 데이터셋이 식품 인식 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2스택형 글로벌-로컬 주의 네트워크가 식품 인식을 위해 전반적 외관과 세밀한 국소적 특징을 효과적으로 포착할 수 있는가?
  • RQ3제안된 SGLANet 모델이 ETHZ Food-101 및 Vireo Food-172와 같은 기존 기준 데이터셋으로 잘 일반화되는가?
  • RQ4ISIA Food-500에서 사전 훈련된 모델이 후행 식품 인식 작업의 성능을 얼마나 향상시키는가?
  • RQ5전반적 및 국소적 주의 메커니즘이 세밀한 식품 인식을 위한 구분 능력 있는 특징을 포착하는 데 어떻게 상호 보완적인가?

주요 결과

  • ISIA Food-500에서 SGLANet는 10-크롭 테스트 설정 하에 Top-1 정확도 90.33%와 Top-5 정확도 98.20%를 기록하며, 여러 기준 모델을 능가한다.
  • ETHZ Food-101에서 미세조정한 SGLANet는 1-크롭 설정에서 Top-1 정확도 90.47%, 10-크롭 설정에서 90.92%를 기록하여 강력한 일반화 능력을 보였다.
  • Vireo Food-172에서 사전 훈련된 모델을 사용할 경우 SGLANet는 1-크롭 설정에서 Top-1 정확도 90.78%, 10-크롭 설정에서 90.98%를 기록하며 대부분의 기준 모델을 능가했다.
  • ETHZ Food-101에서 사전 훈련된 SGLANet 모델을 사용한 성능 향상은 약 0.8%였고, Vireo Food-172에서는 약 0.9%였으며, 이는 ISIA Food-500가 전이 학습에 효과적임을 확인한다.
  • SGLANet는 ISIA Food-500에서 최고 성능을 기록하며, 다른 기준 데이터셋에서도 경쟁력 있는 결과를 내어, 대규모 식품 인식의 강력한 기준 모델로 자리매김했다.
  • 제거 실험을 통해 전반적 및 국소적 특징 학습 구성 요소가 최종 성능에 크게 기여하며, 두 요소의 융합이 가장 우수한 성능을 내는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.