Skip to main content
QUICK REVIEW

[論文レビュー] Nutrition5k: Towards Automatic Nutritional Understanding of Generic Food

Quin Thames, Arjun Karpur|arXiv (Cornell University)|Mar 4, 2021
Nutritional Studies and Diet参考文献 19被引用数 12
ひとこと要約

Nutrition5k は、5,000 種類の現実世界の一般的な料理を含む、高精度な栄養アノテーション、RGB 動画、深度画像、および成分の重量を備えた新しいデータセットを紹介する。本研究では、このデータで学習されたディープラーニングモデルが、プロの栄養士よりもカロリーおよび栄養素含有量をより正確に予測できることを示しており、深度データの導入により、食事量の推定が顕著に向上している。

ABSTRACT

Understanding the nutritional content of food from visual data is a challenging computer vision problem, with the potential to have a positive and widespread impact on public health. Studies in this area are limited to existing datasets in the field that lack sufficient diversity or labels required for training models with nutritional understanding capability. We introduce Nutrition5k, a novel dataset of 5k diverse, real world food dishes with corresponding video streams, depth images, component weights, and high accuracy nutritional content annotation. We demonstrate the potential of this dataset by training a computer vision algorithm capable of predicting the caloric and macronutrient values of a complex, real world dish at an accuracy that outperforms professional nutritionists. Further we present a baseline for incorporating depth sensor data to improve nutrition predictions. We will publicly release Nutrition5k in the hope that it will accelerate innovation in the space of nutritional understanding.

研究の動機と目的

  • 一般的な料理の自動栄養理解のための多様で正確にラベル付けされたデータセットの不足に対処すること。
  • 食事量や正確な栄養アノテーションが欠落している既存のデータセットの限界を克服すること。
  • 現実世界のカフェテリアで段階的計量とスキャンを用いたスケーラブルなデータ収集手法の開発。
  • 視覚的栄養推定において人間の栄養士を上回るディープラーニングモデルの訓練。
  • 深度センサデータの統合による食事量および栄養予測精度の向上の探求。

提案手法

  • 各材料が皿に追加されるごとに段階的に計量・スキャンすることで、現実世界のカフェテリアでデータを収集した。
  • 回転式のRGBカメラと天井設置のIntel RealSense深度センサを用いて、各料理の360°動画および深度画像を撮影した。
  • 詳細な成分レベルのアノテーションを記録し、正確な重量を記録し、レシピデータベースを用いて総栄養素含量を算出した。
  • 畳み込みニューラルネットワーク(CNN)をRGB画像で学習させ、総カロリーおよび栄養素比を予測した。
  • 段階的スキャンの関係を保持するため、トレーニングセットとテストセットにデータセットを分割した。
  • 質量推定の向上を目的として、深度データを追加の入力モodal としてモデルに統合した。
Figure 1: Example representation of data contained in Nutrition5k .
Figure 1: Example representation of data contained in Nutrition5k .

実験結果

リサーチクエスチョン

  • RQ1現実世界の高精度なデータセットで学習されたディープラーニングモデルは、視覚的推定においてプロの栄養士を上回ることができるか?
  • RQ2深度センサデータは、2次元画像からの食事量および栄養素含量予測の精度向上にどの程度効果的か?
  • RQ3段階的スキャン手法は、多様で現実的で正確にラベル付けされた食品データの収集をどの程度可能にするか?
  • RQ4非専門家と専門家による視覚的食事量推定の性能差はどの程度で、信頼性のあるデータアノテーションに利用可能か?
  • RQ5単一のRGB画像で学習したモデルは、複雑な一般的な料理の栄養素含量予測において、人間の専門家を上回る性能を達成できるか?

主な発見

  • ディープラーニングモデルは、カロリー予測において平均絶対誤差(MAE)が13.4 kcalに達し、非栄養士(53%誤差)および栄養士(41%誤差)の視覚的推定を上回った。
  • モデルの栄養素比予測精度は、プロの栄養士を上回り、複雑で現実世界の料理における一般化性能に優れていることを示した。
  • 深度データを統合することで、2Dモデルと比較して質量推定のMAEが40%低減され、食事量推定の精度が顕著に向上した。
  • 人間による食事量推定は非常に不正確であり、非栄養士は平均53%の誤差、栄養士は41%の誤差を示しており、人間によるラベル付けはデータ収集手法として実用的でないことが示された。
  • Nutrition5k データセットには、細分化された成分レベルのアノテーション、成分の重量、高精度な栄養値を備えた5,000件の多様で現実世界の料理が含まれている。
  • このデータセットは https://github.com/google-research-datasets/Nutrition5k で公開されており、自動栄養理解分野の研究を加速することを目的としている。
Figure 2: RGB image examples from Nutrition5k .
Figure 2: RGB image examples from Nutrition5k .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。