Skip to main content
QUICK REVIEW

[論文レビュー] Extracting Food Substitutes From Food Diary via Distributional Similarity

Palakorn Achananuparp, Ingmar Weber|arXiv (Cornell University)|Jul 29, 2016
Nutritional Studies and Diet参考文献 10被引用数 14
ひとこと要約

本稿では、ベクトル空間モデルを用い、食事記録データにおける食事内共起パターンを活用して、現実世界の食品日記データから食品の代替品を抽出する分布的類似性アプローチを提案する。この手法は、外部知識源に依存せずに代替関係を効果的に捉えることができることを示しており、特にSVDが厳しめの閾値設定下でも高い性能を発揮する。

ABSTRACT

In this paper, we explore the problem of identifying substitute relationship between food pairs from real-world food consumption data as the first step towards the healthier food recommendation. Our method is inspired by the distributional hypothesis in linguistics. Specifically, we assume that foods that are consumed in similar contexts are more likely to be similar dietarily. For example, a turkey sandwich can be considered a suitable substitute for a chicken sandwich if both tend to be consumed with french fries and salad. To evaluate our method, we constructed a real-world food consumption dataset from MyFitnessPal's public food diary entries and obtained ground-truth human judgements of food substitutes from a crowdsourcing service. The experiment results suggest the effectiveness of the method in identifying suitable substitutes.

研究の動機と目的

  • 外部知識源に依存せずに、実世界の自己報告による食品摂取データから食品の代替品を同定するデータ駆動型手法の開発。
  • 類似した食事文脈で摂取される食品が、より多くの代替関係を示すかどうかを、自然言語処理における分布的仮説に基づき検証すること。
  • 特にPPMI行列とSVDを含むベクトル空間モデルの有効性を、人間がアノテートした基準ラベルを用いて、食品代替ペアのランク付けの観点から評価すること。
  • 特にタンパク質群に注目して、食品サブカテゴリ全体における共起および代替行動の分析を通じて、ユーザーの食事パターンを解明すること。

提案手法

  • 食品とその食事文脈の間の共起強度を測るため、正のポイントワイズ相互情報量(PPMI)を用いて食品-文脈行列を構築する。
  • 次元削減とベクトル空間モデル内での意味的類似性表現の向上のため、特異値分解(SVD)を適用する。
  • 食品アイテムのベクトル間のコサイン類似度を用いて、共通する食事文脈に基づく潜在的な代替関係を計算する。
  • 2,000組の食品ペアについて、二値の判断基準(τ=3 または τ=4)に基づく人間によるアノテートされた基準ラベルを収集するために、クラウドソーシングプラットフォーム(CrowdFlower)を活用する。
  • 標準的な情報検索指標(精度@1および@10(prec@1, prec@10)、平均平均精度(MAP)、正規化済みディスcount累積利得(NDCG))を用いて性能を評価する。
  • 特にタンパク質群において、食品サブカテゴリごとの共起頻度を正規化して代替パターンを可視化する。

実験結果

リサーチクエスチョン

  • RQ1外部知識に依存せずに、食事レベルの共起パターンにおける分布的類似性が、食品の代替品を効果的に同定できるか?
  • RQ2人間によるアノテートされた判断に基づく場合、PPMI行列とSVDの両方のベクトル空間モデルは、食品代替ペアのランク付けにおいてどのように比較されるか?
  • RQ3人間の合意に stricter な閾値(τ=4)を適用することで、高品質な代替ペアの検出性が、緩めの閾値(τ=3)よりも向上するか?
  • RQ4共起分析によって明らかになるところ、主要な食品サブカテゴリ全体、特にタンパク質群内での支配的代替パターンは何か?

主な発見

  • τ=3 の場合、PPMI行列とSVDは同等の性能を示し、prec@1 は 0.75 と 0.77、prec@10 は両者とも 0.777、MAP は 0.826 と 0.823 であった。
  • τ=4 の場合、SVDはPPMI行列を顕著に上回り、prec@1 は 0.69(対象 0.58)、prec@10 は 0.696(対象 0.567)、MAP は 0.755(対象 0.673)を記録した。これは、人間の判断基準が厳しくなっても、SVDがより高い耐性を示していることを示している。
  • NDCGではPPMI行列がSVDをわずかに上回り(0.811 対 0.772)、これは、高めの閾値下でもトップ10リストのランク品質が優れていることを示唆している。
  • PPMI行列が同定した「Tim Bacon」の上位10位の代替品は、主に加工肉(例:ソーセージ、ベーコン)であり、タンパク質群における文脈ベースの類似性が強いことを示している。
  • 共起分析から、代替は特に家禽類(例:鶏肉とツキネ)の間で最も頻繁に発生しており、植物性タンパク質は肉の代替としてほとんど使われていないことが判明した。
  • クラウドソーシングのラベルには文化的バイアスが存在し、多くの作業者が米国以外の国(例:インドネシア、インド)に所属していたため、代替判断の文化的一般化性に影響を及ぼす可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。