Skip to main content
QUICK REVIEW

[論文レビュー] NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

Andong Hua, Mehak Preet Dhaliwal|ArXiv.org|Jul 4, 2024
Culinary Culture and TourismAgricultural and Biological Sciences被引用数 3
ひとこと要約

NutriBenchは、自然言語による食事記述からの栄養推定を評価するための、公開済みの最初のベンチマークである。5,000件の人が検証済みの食事記述を含み、マクロ栄養素およびカロリーのラベルが15の複雑さベースのサブセットに分けられている。Chain-of-Thoughtプロンプティングを用いたGPT-3.5は、複雑なクエリにおいても、スピードと正確性の両面でプロフェッショナルな栄養士を上回る51.48%の正確性を達成した。

ABSTRACT

Accurate nutrition estimation helps people make informed dietary choices and is essential in the prevention of serious health complications. We present NutriBench, the first publicly available natural language meal description nutrition benchmark. NutriBench consists of 11,857 meal descriptions generated from real-world global dietary intake data. The data is human-verified and annotated with macro-nutrient labels, including carbohydrates, proteins, fats, and calories. We conduct an extensive evaluation of NutriBench on the task of carbohydrate estimation, testing twelve leading Large Language Models (LLMs), including GPT-4o, Llama3.1, Qwen2, Gemma2, and OpenBioLLM models, using standard, Chain-of-Thought and Retrieval-Augmented Generation strategies. Additionally, we present a study involving professional nutritionists, finding that LLMs can provide comparable but significantly faster estimates. Finally, we perform a real-world risk assessment by simulating the effect of carbohydrate predictions on the blood glucose levels of individuals with diabetes. Our work highlights the opportunities and challenges of using LLMs for nutrition estimation, demonstrating their potential to aid professionals and laypersons and improve health outcomes. Our benchmark is publicly available at: https://mehak126.github.io/nutribench.html

研究の動機と目的

  • 自然言語ベースの栄養推定におけるLLMの評価のためのベンチマークが不足しているという問題に対処すること。特に、現実世界の食事記述に対して。
  • マクロ栄養素およびカロリーのアノテーションが付された、多様で人が検証済みの5,000件の食事記述のデータセットを構築し、堅牢なLLM評価を支援すること。
  • 複数の食品項目、サービング数、サービングサイズの明確さといった要因を含む、食事記述の複雑さの異なるレベルにおける最先端のLLMのパフォーマンスを評価すること。
  • 炭水化物推定タスクにおいて、LLMと人間の専門家との間で正確性、スピード、ストレス反応を比較すること。
  • 今後の研究におけるLLM駆動の食事評価および臨床栄養応用のための標準化されたベンチマークを提供すること。

提案手法

  • データセットNutriBenchは、食事記述の収集、専門家による検証、およびFoodData Centralなどの権威ある栄養データベースを用いたラベル付けを含む、段階的なプロセスによって構築された。
  • 5,000件の食事記述は、食品項目数、サービング数、食品の人気度、サービングサイズ記述の明確さといった複雑さ要因に基づき15のサブセットに分類された。
  • 標準プロンプティング、Chain-of-Thought(CoT)、リtrieval-augmented generation(RAG)、Few-shotプロンプティングの4つのプロンプティング戦略を用いて、GPT-3.5、Llama-3、MedAlpacaなど7つの最先端のLLMが評価された。
  • 同一のクエリに対して、10名の非専門家および1名のプロフェッショナルな栄養士を対象にした人間の研究が実施され、推定の正確性、所要時間、ストレスレベルを比較した。
  • 正確性、回答率、平均絶対誤差(MAE)、正規化誤差を用いてパフォーマンスを測定し、各サブセットおよび食品カテゴリごとに誤差分析が行われた。
  • 予測誤差と炭水化物含有量やサービングサイズのばらつきといった要因との相関関係を評価するため、統計的分析が実施された。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデル(LLM)は、自然言語による食事記述から、特に炭水化物を正確に推定できるか?
  • RQ2複数の食品項目や非標準的なサービングサイズを含むような、食事記述の複雑さの異なるレベルにおいて、モデルのパフォーマンスはどのように変化するか?
  • RQ3LLMは、食事の栄養推定において、正確性、スピード、一貫性の面で人間の専門家を上回ることができるか?
  • RQ4Chain-of-Thought やリトリーブ増強生成(RAG)といったプロンプティング戦略が、栄養推定におけるLLMのパフォーマンスに与える影響は何か?
  • RQ5予測誤差は、真のマクロ栄養素含有量(特に高炭水化物食品)とどのように相関しているか?

主な発見

  • Chain-of-Thoughtプロンプティングを用いたGPT-3.5は、全NutriBenchベンチマークで最高の正確性51.48%を達成し、回答率は89.80%であった。
  • LLMは、正確性とスピードの両面でプロフェッショナルな栄養士を著しく上回った。90件のクエリを2分未満で完了した一方、栄養士は50分を要した。
  • 平均絶対誤差(MAE)は、真の炭水化物含有量が高くなるにつれて増加し、高炭水化物食においてより大きな誤差が生じることを示した。
  • 複数サービングサブセットでは、正規化誤差が高かったが、主に非標準的なサービングサイズに対する初期予測の不正確さが原因であり、計算ミスによるものではなかった。
  • LLMはクエリ長に関係なく一貫したパフォーマンスを示したが、人間の参加者はより複雑な記述に対して著しくストレスを感じた。
  • 本研究により、特に100g基準とは異なるサービングサイズを含む複雑な現実世界の食事記述において、LLMが人間の専門家よりも信頼性が高いことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。