[论文解读] Nutrition5k: Towards Automatic Nutritional Understanding of Generic Food
Nutrition5k 引入了一个新颖的数据集,包含5,000种真实世界中的通用食物菜肴,具有高精度的营养标注、RGB视频、深度图像和成分重量。该研究证明,使用此数据训练的深度学习模型在卡路里和宏量营养素含量预测方面优于专业营养师,且深度数据显著提升了份量估算的准确性。
Understanding the nutritional content of food from visual data is a challenging computer vision problem, with the potential to have a positive and widespread impact on public health. Studies in this area are limited to existing datasets in the field that lack sufficient diversity or labels required for training models with nutritional understanding capability. We introduce Nutrition5k, a novel dataset of 5k diverse, real world food dishes with corresponding video streams, depth images, component weights, and high accuracy nutritional content annotation. We demonstrate the potential of this dataset by training a computer vision algorithm capable of predicting the caloric and macronutrient values of a complex, real world dish at an accuracy that outperforms professional nutritionists. Further we present a baseline for incorporating depth sensor data to improve nutrition predictions. We will publicly release Nutrition5k in the hope that it will accelerate innovation in the space of nutritional understanding.
研究动机与目标
- 解决自动营养理解领域中缺乏多样化、精确标注数据集的问题,尤其针对通用食物菜肴。
- 克服现有数据集缺乏份量大小和精确营养标注的局限性。
- 开发一种可扩展的数据采集方法,通过在真实餐厅中逐项称重和扫描食材实现。
- 训练一种深度学习模型,使其在视觉营养估算方面超越人类营养师。
- 探索整合深度传感器数据以提升份量大小和营养预测准确性的潜力。
提出的方法
- 通过在真实餐厅中逐项称重和扫描每种添加到盘子中的食材,收集数据。
- 使用旋转的RGB摄像头和顶部的Intel RealSense深度传感器,捕捉每道菜肴的360°视频和深度图像。
- 记录详细的成分级标注,包括精确重量,并利用食谱数据库推导出总营养成分。
- 在RGB图像上训练深度卷积神经网络(CNN),以预测总卡路里和宏量营养素比例。
- 将深度数据作为额外的输入模态引入模型,以改善份量大小估算。
- 在保留增量扫描时间关系的前提下,将数据集划分为训练集和测试集。

实验结果
研究问题
- RQ1在真实世界、高精度数据集上训练的深度学习模型,是否能在视觉估算卡路里和宏量营养素含量方面超越专业营养师?
- RQ2深度传感器数据在利用2D图像提升份量大小和营养成分预测准确性方面有多有效?
- RQ3增量扫描方法在多大程度上实现了多样化、真实且精确标注的食物数据采集?
- RQ4非专业人士与专家在视觉份量大小估算方面的性能差距有多大?该差距是否可被可靠地用于数据标注?
- RQ5在仅使用单张RGB图像进行训练的模型,是否能在复杂、通用的菜肴营养成分预测方面超越人类专家?
主要发现
- 该深度学习模型在卡路里预测上的平均绝对误差(MAE)为13.4 kcal,优于非营养师(53%误差)和营养师(41%误差)的视觉估算表现。
- 该模型在宏量营养素预测方面的准确性超过专业营养师,表明其在复杂、真实世界菜肴上的泛化能力更优。
- 引入深度数据后,质量估算的MAE相比仅使用2D图像的模型降低了40%,显著提升了份量大小预测的准确性。
- 人类份量大小估算极不准确,非营养师平均误差达53%,营养师为41%,表明人类标注不可靠,不适合作为数据采集方法。
- Nutrition5k 数据集包含5,000种多样化的真实世界菜肴,具有细粒度的成分级标注、各成分重量和高精度的营养值。
- 该数据集已公开发布于 https://github.com/google-research-datasets/Nutrition5k,以加速自动营养理解领域的研究。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。