Skip to main content
QUICK REVIEW

[논문 리뷰] Fully-Automatic Semantic Segmentation for Food Intake Tracking in Long-Term Care Homes.

Kaylen J. Pfisterer, Robert Amelard|arXiv (Cornell University)|2019. 10. 24.
Nutritional Studies and Diet참고 문헌 31인용 수 5
한 줄 요약

이 논문은 장기 간병(LTC) 환경에서 접시 위 음식 픽셀을 분류하기 위해 다중 척도 인코더-디코더 아키텍처를 갖춘 딥 컨volution 신경망(DCNN)을 사용하는 완전 자동(semi-automatic) 의미 분할 방법을 제안한다. UNIMIB 2016 데이터셋으로 훈련하고 새로운 LTC 플레이트 데이터셋으로 테스트한 결과, 교차율(Intersection over Union, IoU)이 91.2%를 기록했으며, 사용자 애너테이션을 제거하고 오류 일관성을 향상시켜 반자동 그래프 컷( graph cuts)과 동등한 성능을 달성했다.

ABSTRACT

Malnutrition impacts quality of life and places annually-recurring burden on the health care system. Half of older adults are at risk for malnutrition in long-term care (LTC). Monitoring and measuring nutritional intake is paramount yet involves time-consuming and subjective visual assessment, limiting current methods' reliability. The opportunity for automatic image-based estimation exists. Some progress outside LTC has been made (e.g., calories consumed, food classification), however, these methods have not been implemented in LTC, potentially due to a lack of ability to independently evaluate automatic segmentation methods within the intake estimation pipeline. Here, we propose and evaluate a novel fully-automatic semantic segmentation method for pixel-level classification of food on a plate using a deep convolutional neural network (DCNN). The macroarchitecture of the DCNN is a multi-scale encoder-decoder food network (EDFN) architecture comprising a residual encoder microarchitecture, a pyramid scene parsing decoder microarchitecture, and a specialized per-pixel food/no-food classification layer. The network was trained and validated on the pre-labelled UNIMIB 2016 food dataset (1027 tray images, 73 categories), and tested on our novel LTC plate dataset (390 plate images, 9 categories). Our fully-automatic segmentation method attained similar intersection over union to the semi-automatic graph cuts (91.2% vs. 93.7%). Advantages of our proposed system include: testing on a novel dataset, decoupled error analysis, no user-initiated annotations, with similar segmentation accuracy and enhanced reliability in terms of types of segmentation errors. This may address several short-comings currently limiting utility of automated food intake tracking in time-constrained LTC and hospital settings.

연구 동기 및 목표

  • 장기 간병(LTC) 환경에서 음식 섭취를 모니터링하기 위한 신뢰할 수 있는 자동화된 도구의 부족을 해결하기 위해.
  • 사용자 시작 애너테이션을 제거하는 완전 자동 의미 분할 시스템을 개발하기 위해.
  • 새로운 LTC 전용 플레이트 이미지 데이터셋에서의 분할 성능 평가를 위해.
  • 임상적 배포 시 신뢰성을 향상시키기 위해 오차 분석을 분리(Decoupled)할 수 있도록 하기 위해.
  • 시간 제약이 있는 헬스케어 환경에서 자동 음식 섭취 추적의 실용성을 향상시키기 위해.

제안 방법

  • 다중 척도 인코더-디코더 식품 네트워크(EDFN) 아키텍처를 사용하여 잔차 인코더와 피라미드 시나리오 분석 디코더를 통합한다.
  • 네트워크는 접시 위의 음식 영역과 비음식 영역을 구분하기 위해 픽셀 단위 분류 레이어를 활용한다.
  • 감독 학습을 사용하여 사전 애너테이션된 UNIMIB 2016 데이터셋(1027장의 트레이 이미지, 73개 카테고리)으로 모델을 훈련한다.
  • 실제 성능 평가를 위해 새로운 LTC 플레이트 데이터셋(390장의 이미지, 9개 카테고리)을 사용하여 테스트를 수행한다.
  • 아키텍처는 다중 척도 특징 학습을 가능하게 하여 복잡한 음식 배열에서의 분할 정확도를 향상시킨다.
  • 추론 과정에서 사용자 상호작용이 필요 없어 임상 워크플로우에서 완전 자동 운영이 가능하다.

실험 결과

연구 질문

  • RQ1완전 자동 의미 분할 모델이 음식 섭취 추적에서 반자동 방법과 비교해 유사한 정확도를 달성할 수 있는가?
  • RQ2제안된 방법은 존재하는 벤치마크와 비교해 새로운 LTC 전용 이미지 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ3모델은 어떤 유형의 분할 오차를 생성하는가? 반자동 접근 방식과의 오차 유형은 어떻게 다를까?
  • RQ4사용자 애너테이션 없이도 임상 환경에서 높은 신뢰성을 유지하면서 배포가 가능한가?
  • RQ5분리된 오차 분석은 전통적 방법에 비해 오차 패턴에서 체계적인 향상을 드러내는가?

주요 결과

  • 제안된 완전 자동 방법은 새로운 LTC 플레이트 데이터셋에서 91.2%의 교차율(Intersection over Union, IoU)을 달성했다.
  • 이 성능는 동일한 테스트 세트에서 93.7% IoU를 기록한 반자동 그래프 컷과 유사한 성능이다.
  • 사용자 시작 애너테이션의 필요성을 제거하여 확장성과 운영 효율성을 향상시켰다.
  • 오차 분석 결과, 반자동 방법에 비해 더 일관되고 예측 가능한 분할 오차 패턴을 보였다.
  • 모델는 다양한 음식 카테고리(9개)에 대해 실제 LTC 환경에 효과적으로 일반화되었으며, 강건성을 입증했다.
  • 결과적으로, 시간 제약이 있는 헬스케어 환경에서 완전 자동 의미 분할이 수동 또는 반자동 접근 방식에 대한 신뢰할 수 있는 대안이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.