Skip to main content
QUICK REVIEW

[论文解读] NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

Andong Hua, Mehak Preet Dhaliwal|ArXiv.org|Jul 4, 2024
Culinary Culture and TourismAgricultural and Biological Sciences被引用 3
一句话总结

NutriBench 是首个公开可用的基准,用于评估大型语言模型(LLMs)从自然语言餐食描述中进行营养估算的表现,包含 5,000 份经人工验证的餐食描述,涵盖 15 个基于复杂度的子集,附带宏量营养素和卡路里标签。使用思维链(Chain-of-Thought)提示的 GPT-3.5 在复杂查询中实现了 51.48% 的准确率,其速度和准确率均超过专业营养师。

ABSTRACT

Accurate nutrition estimation helps people make informed dietary choices and is essential in the prevention of serious health complications. We present NutriBench, the first publicly available natural language meal description nutrition benchmark. NutriBench consists of 11,857 meal descriptions generated from real-world global dietary intake data. The data is human-verified and annotated with macro-nutrient labels, including carbohydrates, proteins, fats, and calories. We conduct an extensive evaluation of NutriBench on the task of carbohydrate estimation, testing twelve leading Large Language Models (LLMs), including GPT-4o, Llama3.1, Qwen2, Gemma2, and OpenBioLLM models, using standard, Chain-of-Thought and Retrieval-Augmented Generation strategies. Additionally, we present a study involving professional nutritionists, finding that LLMs can provide comparable but significantly faster estimates. Finally, we perform a real-world risk assessment by simulating the effect of carbohydrate predictions on the blood glucose levels of individuals with diabetes. Our work highlights the opportunities and challenges of using LLMs for nutrition estimation, demonstrating their potential to aid professionals and laypersons and improve health outcomes. Our benchmark is publicly available at: https://mehak126.github.io/nutribench.html

研究动机与目标

  • 为解决缺乏评估 LLM 在基于自然语言的营养估算任务中表现的基准问题,特别是针对现实世界中的餐食描述。
  • 创建一个多样化、经人工验证的数据集,包含 5,000 份带有宏量营养素和卡路里标注的餐食描述,以支持 LLM 的稳健评估。
  • 评估最先进 LLM 在不同复杂度水平的餐食描述中的表现,包括多种食物项目、分量数量以及分量大小描述的精确性。
  • 比较 LLM 与人类专家在碳水化合物估算任务中的准确率、速度和压力反应表现。
  • 为未来基于 LLM 的饮食评估和临床营养应用研究提供标准化基准。

提出的方法

  • 数据集 NutriBench 通过多阶段流程构建,包括餐食描述收集、专家验证以及使用权威营养数据库(如 FoodData Central)进行标注。
  • 5,000 份餐食描述根据复杂度因素划分为 15 个子集:食物项目数量、分量数量、食物流行度以及分量大小描述的精确性。
  • 使用四种提示策略评估了七种最先进 LLM(GPT-3.5、Llama-3、MedAlpaca 等):标准提示、思维链(CoT)、检索增强生成(RAG)和 few-shot 提示。
  • 开展了一项人类研究,包含 10 名非专家和一名专业营养师,以比较相同查询下的估算准确率、耗时和压力水平。
  • 性能通过准确率、回答率、平均绝对误差(MAE)和归一化误差进行衡量,并在每个子集和食物类别中进行误差分析。
  • 进行统计分析,以评估预测误差与碳水化合物含量、分量大小可变性等因子之间的相关性。

实验结果

研究问题

  • RQ1大型语言模型能否从自然语言餐食描述中准确估算宏量营养素,特别是碳水化合物?
  • RQ2模型在不同复杂度水平的餐食描述(如多种食物项目或非标准分量大小)中的表现如何变化?
  • RQ3LLM 在估算餐食营养时,是否在准确率、速度和一致性方面优于人类专家?
  • RQ4思维链(Chain-of-Thought)和检索增强生成(Retrieval-Augmented Generation)等提示策略对 LLM 在营养估算中的表现有何影响?
  • RQ5预测误差与真实宏量营养素含量之间是否存在相关性,特别是在高碳水化合物食物中?

主要发现

  • 使用思维链提示的 GPT-3.5 在完整 NutriBench 基准上实现了 51.48% 的最高准确率,回答率为 89.80%。
  • LLM 在准确率和速度方面显著优于专业营养师,仅用不到 2 分钟完成 90 个查询,而营养师耗时 50 分钟。
  • 平均绝对误差(MAE)随真实碳水化合物含量的升高而增加,表明高碳水化合物餐食的误差更大。
  • 多分量子集的归一化误差更高,主要原因是对不常见分量大小的初始预测不准确,而非计算错误。
  • LLM 在不同长度查询中表现一致,而人类参与者在面对更复杂的描述时报告了显著增加的压力。
  • 研究结果表明,LLM 在复杂、现实世界的餐食描述中比人类专家更可靠,尤其是在分量大小偏离标准 100g 规范时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。