Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Task Image-Based Dietary Assessment for Food Recognition and Portion Size Estimation

Jiangpeng He, Zeman Shao|arXiv (Cornell University)|2020. 04. 27.
Nutritional Studies and Diet참고 문헌 27인용 수 5
한 줄 요약

이 논문은 L2-노름 기반 소프트 파rameter 공유와 정규화를 통한 교차 도메인 특징 적응을 활용하여 단일 이미지에서 음식 분류와 식량 섭취량 추정을 동시에 수행하는 엔드 투 엔드 다중 작업 딥 러닝 프레임워크를 제안한다. 이 방법은 최신 기술 수준의 성능을 달성하여 정확히 분류된 음식의 평균 절대 오차를 50.86 Kcal로 줄였으며, 인간의 추정보다 오차 감소율이 28.57% 높다.

ABSTRACT

Deep learning based methods have achieved impressive results in many applications for image-based diet assessment such as food classification and food portion size estimation. However, existing methods only focus on one task at a time, making it difficult to apply in real life when multiple tasks need to be processed together. In this work, we propose an end-to-end multi-task framework that can achieve both food classification and food portion size estimation. We introduce a food image dataset collected from a nutrition study where the groundtruth food portion is provided by registered dietitians. The multi-task learning uses L2-norm based soft parameter sharing to train the classification and regression tasks simultaneously. We also propose the use of cross-domain feature adaptation together with normalization to further improve the performance of food portion size estimation. Our results outperforms the baseline methods for both classification accuracy and mean absolute error for portion estimation, which shows great potential for advancing the field of image-based dietary assessment.

연구 동기 및 목표

  • 단일 이미지에서 동시에 음식 분류와 식량 섭취량 추정을 수행하는 엔드 투 엔드 다중 작업 학습 프레임워크를 개발하는 것.
  • 기존의 단일 작업 기반 방법들이 실생활 식이 평가 시스템에 효율적으로 통합되지 못하는 한계를 해결하는 것.
  • 교차 도메인 특징 적응을 통해 음식 분류에서의 지식을 활용하여 식량 섭취량 추정 정확도를 향상시키는 것.
  • 정규화 기법(LN, BN)이 다중 작업 회귀 및 분류 작업에서 오차를 줄이는 데 미치는 영향을 조사하는 것.
  • 등록 dietician에 의한 참값 음식 카테고리 및 식량 섭취량이 레이블링된 새로운 실생활 데이터셋을 구축하고 공개하는 것.

제안 방법

  • 분류 및 회귀 네트워크의 하위층을 정규화하기 위해 L2-노름 기반 소프트 파arameter 공유를 사용하여, 공유된 특징 공간을 강제로 만들지 않고도 지식 전이를 가능하게 한다.
  • 분류 및 회귀 브랜치의 특징 벡터를 연결하여 교차 도메인 특징 적응을 적용함으로써, 음식 카테고리 사전 지식을 바탕으로 식량 섭취량 추정을 향상시킨다.
  • 특징 분포를 도메인 간에 일치시켜 회귀 성능을 향상시키기 위해 레이어 정규화(LN)와 배치 정규화(BN)를 활용한다.
  • Adam 옵timizer를 사용하여 100 에포크 동안 18층의 ResNet 기반 모델을 훈련시키며, 학습률 스케줄링으로 코시 감쇠와 가중치 감소를 적용한다.
  • 분류 정확도와 식량 섭취량 추정 오차 간의 균형을 맞추기 위해 새로운 평가 지표인 MCCR(MAE to Correctly Classified Ratio)를 도입한다.
  • 실제 식사 상황을 반영할 수 있도록 등록 dietician가 제공한 참값 식량 섭취량이 레이블링된 새로운 식사 기록 데이터셋을 수집하여 식량 섭취량 평가의 현실성 향상을 도모한다.

실험 결과

연구 질문

  • RQ1다중 작업 프레임워크에서 소프트 파arameter 공유가 단일 작업 기반 베이스라인 대비 음식 분류 정확도 향상과 식량 섭취량 추정 오차 감소에 기여하는가?
  • RQ2분류 및 회귀 브랜치 간의 교차 도메인 특징 적응이 식량 섭취량 추정 성능 향상에 기여하는가?
  • RQ3다양한 정규화 기법(LN, BN, LN+BN)이 다중 작업 네트워크 성능에 미치는 영향은 어떠한가?
  • RQ4제안된 다중 작업 프레임워크가 인간의 추정에 비해 식량 섭취량 평가에서 뛰어난 성능을 보일 수 있는가?
  • RQ5공유된 하위층 정규화를 통한 공동 학습이 영상 기반 식이 평가에서 일반화 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 다중 작업 프레임워크는 모든 음식에 대해 88.67%의 분류 정확도와 56.82 Kcal의 평균 절대 오차(MAE)를 기록하여, 단일 작업 기반 베이스라인(86.08%, 62.27 Kcal)을 능가했다.
  • 정확히 분류된 음식에 대해서는 MAE가 50.86 Kcal로 감소하여, 특징 적응과 정규화를 통한 공동 학습의 유용성을 입증했다.
  • LN+BN 정규화를 사용할 경우 가장 뛰어난 성능을 기록하여, 개별 정규화 또는 정규화 없이 사용한 경우보다 MAE를 유의미하게 감소시켰다.
  • 정규화를 통한 교차 도메인 특징 적응은 정규화 없이 특징을 연결한 경우 대비 MAE를 11.5% 감소시켜 도메인 정렬 측면에서의 효과성을 입증했다.
  • 모델의 오차율은 인간 추정의 45.43%에서 16.83%로 감소하여 인간 추정을 능가하는 정확도를 보였으며, 식량 섭취량 추정의 우수성을 입증했다.
  • MCCR 지표는 분류가 정확할 경우 모델의 식량 섭취량 추정이 더 신뢰할 수 있음을 확인하여 다중 작업 접근의 일관성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.