[논문 리뷰] Large Scale Visual Food Recognition
이 논문은 2,000개의 카테고리와 100만 장이 넘는 이미지를 포함한 가장 큰 음식 인식 데이터셋인 Food2K를 소개한다. 이는 기존 데이터셋에 비해 규모 면에서 크게 뛰어나며, 프로그레시브 훈련과 자기주의(self-attention)를 활용한 딥 프로그레시브 리전 강화 네트워크를 제안하여 다양한 국소적 특징을 학습하고 다중 척도의 맥락을 통합함으로써 성능을 향상시킨다. 이는 음식 인식, 검색, 객체 탐지, 세분화, 다중 모odal 레시피 작업 등 다양한 분야에서 최신 기술 수준의 성능과 뛰어난 일반화 능력을 달성한다.
Food recognition plays an important role in food choice and intake, which is essential to the health and well-being of humans. It is thus of importance to the computer vision community, and can further support many food-oriented vision and multimodal tasks. Unfortunately, we have witnessed remarkable advancements in generic visual recognition for released large-scale datasets, yet largely lags in the food domain. In this paper, we introduce Food2K, which is the largest food recognition dataset with 2,000 categories and over 1 million images.Compared with existing food recognition datasets, Food2K bypasses them in both categories and images by one order of magnitude, and thus establishes a new challenging benchmark to develop advanced models for food visual representation learning. Furthermore, we propose a deep progressive region enhancement network for food recognition, which mainly consists of two components, namely progressive local feature learning and region feature enhancement. The former adopts improved progressive training to learn diverse and complementary local features, while the latter utilizes self-attention to incorporate richer context with multiple scales into local features for further local feature enhancement. Extensive experiments on Food2K demonstrate the effectiveness of our proposed method. More importantly, we have verified better generalization ability of Food2K in various tasks, including food recognition, food image retrieval, cross-modal recipe retrieval, food detection and segmentation. Food2K can be further explored to benefit more food-relevant tasks including emerging and more complex ones (e.g., nutritional understanding of food), and the trained models on Food2K can be expected as backbones to improve the performance of more food-relevant tasks. We also hope Food2K can serve as a large scale fine-grained visual recognition benchmark.
연구 동기 및 목표
- 음식 시각 인식 분야에서 대규모 고품질 데이터셋의 부족으로 음식 컴퓨팅 및 세분화된 시각 분석 분야의 발전이 제한되고 있는 문제를 해결하기 위해.
- 음식 인식 및 관련 시각 작업에서 고도화된 모델을 훈련하고 평가하기 위한 확장 가능한 벤치마크를 구축하기 위해.
- 프로그레시브 훈련과 주의 메커니즘을 통해 모델이 세분화된, 다양한, 맥락이 풍부한 특징을 학습할 수 있도록 음식 시각 표현 학습을 향상시키기 위해.
- 이미지 인식, 검색, 탐지, 세분화, 다중 모달 레시피 검색 등 다양한 후행 작업에 대해 Food2K의 일반화 능력을 입증하기 위해.
- 소수 샘플 음식 인식, 요리 종류 간 전이 학습, 슈퍼클래스 간 전이 학습, 음식 이미지 생성과 같은 새로운 애플리케이션을 지원하기 위해.
제안 방법
- 음식 이미지에서 다양한 상호보완적인 시각적 패턴을 포착하기 위해 프로그레시브 훈련 전략을 활용하는 딥 프로그레시브 리전 강화 네트워크(DPREN)를 제안한다.
- 국소적 특징에 맥락 정보를 통합하기 위해 다중 척도 자기주의를 활용하는 리전 특징 강화 모듈을 도입하여 특징의 구분 능력을 향상시킨다.
- 반복적인 데이터 정제, 전문가 애너테이션, 품질 관리를 통해 Food2K 데이터셋의 높은 신뢰성과 다양성을 확보한다.
- 채소, 고기, 프라이드 푸드 등 슈퍼클래스에 걸쳐 2,000개의 카테고리로 구성된 계층적 음식 온톨로지를 활용하여 의미론적 커버리지와 확장성을 확보한다.
- Food2K에서 모델을 훈련하고, 제로샷 및 소수 샘플 평가 프로토콜을 사용하여 후행 작업으로의 전이 능력을 평가한다.
- 요리 종류, 슈퍼클래스, 시나리오 간 전이 학습을 지원하여 교차 도메인 일반화 분석을 가능하게 한다.
실험 결과
연구 질문
- RQ1대규모 고품질 음식 데이터셋이 음식 시각 인식 모델의 성능 향상과 일반화 능력 향상에 뚜렷한 영향을 미칠 수 있는가?
- RQ2프로그레시브 훈련이 세분화된 음식 인식을 위한 다양한 상호보완적인 국소적 특징을 학습하는 데 얼마나 효과적인가?
- RQ3자기주의 메커니즘이 다중 척도 맥락을 통합함으로써 국소적 특징을 얼마나 효과적으로 향상시킬 수 있는가?
- RQ4Food2K에서 사전 훈련된 모델이 음식 탐지, 세분화, 다중 모달 레시피 검색 등의 후행 작업으로 효과적으로 일반화될 수 있는가?
- RQ5Food2K가 소수 샘플 음식 인식 및 다국적 요리 간 전이 학습과 같은 새로운 작업을 위한 벤치마크로 활용될 잠재력은 어느 정도인가?
주요 결과
- Food2K는 2,000개의 카테고리에 걸쳐 총 1,036,564장의 이미지를 포함하며, 기존 데이터셋에 비해 카테고리 수와 이미지 수 모두에서 한 차원 이상 뛰어나다.
- 제안된 딥 프로그레시브 리전 강화 네트워크는 Food2K에서 최신 기술 수준의 성능을 달성하였으며, 프로그레시브 훈련과 자기주의를 통해 뛰어난 특징 학습 능력을 입증하였다.
- Food2K에서 사전 훈련된 모델은 음식 이미지 인식, 검색, 탐지, 세분화, 다중 모달 레시피 검색 등 다양한 작업에서 뛰어난 일반화 능력을 보였다.
- Food2K는 제로샷 및 소수 샘플 전이 학습을 효과적으로 지원하며, 다국적 요리 및 슈퍼클래스 간 전이 학습 시나리오에서 유망한 성능을 기록하였다.
- GAN 기반 음식 이미지 생성과 같은 새로운 응용 분야를 지원하였으며, 현실적이고 의미적으로 일관된 음식 이미지를 생성하는 데 유망한 결과를 얻었다.
- 데이터셋과 모델은 http://123.57.42.89/FoodProject.html 에 공개되어 있어, 음식 시각 및 다중 모달 학습 분야의 보다 넓은 연구를 촉진한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.