Skip to main content
QUICK REVIEW

[논문 리뷰] Mining Discriminative Food Regions for Accurate Food Recognition

Jianing Qiu, Frank P.-W. Lo|arXiv (Cornell University)|2022. 07. 08.
Advanced Chemical Sensor Technologies인용 수 44
한 줄 요약

본 논문은 Adversarial Erasing으로 판별 가능한 식품 영역을 반복적으로 탐색하고, 지역 특성과 글로벌 특성을 융합하여 엔드-투-엔드 식품 인식을 수행하는 세 가지 분기 네트워크 PAR-Net을 제시한다. 여러 데이터셋에서 최첨단 성능을 달성하며, Sushi-50이라는 새로운 미세 분류 데이터셋이 포함되어 있다.

ABSTRACT

Automatic food recognition is the very first step towards passive dietary monitoring. In this paper, we address the problem of food recognition by mining discriminative food regions. Taking inspiration from Adversarial Erasing, a strategy that progressively discovers discriminative object regions for weakly supervised semantic segmentation, we propose a novel network architecture in which a primary network maintains the base accuracy of classifying an input image, an auxiliary network adversarially mines discriminative food regions, and a region network classifies the resulting mined regions. The global (the original input image) and the local (the mined regions) representations are then integrated for the final prediction. The proposed architecture denoted as PAR-Net is end-to-end trainable, and highlights discriminative regions in an online fashion. In addition, we introduce a new fine-grained food dataset named as Sushi-50, which consists of 50 different sushi categories. Extensive experiments have been conducted to evaluate the proposed approach. On three food datasets chosen (Food-101, Vireo-172, and Sushi-50), our approach performs consistently and achieves state-of-the-art results (top-1 testing accuracy of $90.4\%$, $90.2\%$, $92.0\%$, respectively) compared with other existing approaches. Dataset and code are available at https://github.com/Jianing-Qiu/PARNet

연구 동기 및 목표

  • 자동 식품 인식 정확도를 향상시켜 비활성형 식이 모니터링을 촉진한다.
  • 이미지 내에서 판별 가능한 식품 영역을 발견하기 위한 약지도 학습 방법을 개발한다.
  • 전역 표현과 추출된 지역 표현을 통합하는 엔드-투-엔드 학습 가능한 아키텍처를 설계한다.

제안 방법

  • P-Net(전역 이미지 분류), A-Net(판별 영역이 지워진 상태로 분류), R-Net(추출된 영역을 분류)으로 구성된 세 개의 하위 네트워크를 갖춘 PAR-Net을 도입한다.
  • CAM 히트맵에 의해 안내되는 판별 영역을 점진적으로 탐색하기 위해 Adversarial Erasing을 사용한다.
  • 온라인으로 CAM을 계산하여 판별 영역을 강조하고 R-Net용 영역 크롭을 생성한다.
  • 전체 이미지의 표현과 추출된 영역의 표현을 연결(concatenate)한 뒤, 추가적인 완전 연결 계층으로 분류한다.
  • P-Net, A-Net, R-Net 및 결합된 표현 손실을 포함하는 복합 손실로 엔드-투-엔드 학습한다.

실험 결과

연구 질문

  • RQ1판별 영역 탐색이 글로벌 이미지 특징을 넘어 식품 인식을 향상시킬 수 있는가?
  • RQ2과도한 연산 없이 성능을 극대화하기 위해 얼마만큼의 영역을 추출해야 하는가?
  • RQ3엔드-투-엔드 학습을 통해 글로벌 및 지역 표현을 통합하는 것이 단일 네트워크 기반 베이스라인보다 우수한가?
  • RQ4온라인 CAM 기반 영역 채굴이 식품 인식의 엔드-투-엔드 최적화에 효과적인가?

주요 결과

  • PAR-Net은 Food-101(1-crop: 89.3; 10-crop: 90.4), Vireo-172(1-crop: 89.6; 10-crop: 90.2), Sushi-50(1-crop: 91.8; 10-crop: 92.0)에서 일관되게 최첨단 top-1 정확도를 달성한다.
  • 세 개의 판별 영역(T=3)을 사용하면 관리 가능한 오버헤드로 강력한 성능을 제공한다.
  • 글로벌, 지역 및 지워진 영역 작업용 독립 하위 네트워크가 공유 가중치 또는 단일 네트워크 변형보다 성능이 우수하다.
  • 전역 이미지 특징과 추출된 지역 특징을 연결(concatenate)하는 것이 어느 한 소스만 사용하는 것보다 높은 정확도를 얻는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.