Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Attention Network for Visually-aware Food Recommendation

Xiaoyan Gao, Fuli Feng|arXiv (Cornell University)|Oct 11, 2018
Recommender Systems and Techniques参考文献 54被引用数 6
ひとこと要約

本稿では、階層的アテンション機構を用いて、ユーザーとアイテムの相互作用、レシピの材料、および食品画像からの視覚的特徴を統合的にモデル化するニューラルネットワークモデルである階層的アテンションベースの食品推薦(HAFR)を提案する。HAFRは、大規模な食品推薦データセット上で、因子分解マシンやVisual Bayesian Personalized Rankingなどの最先端手法よりも平均12%の性能向上を達成した。

ABSTRACT

Food recommender systems play an important role in assisting users to identify the desired food to eat. Deciding what food to eat is a complex and multi-faceted process, which is influenced by many factors such as the ingredients, appearance of the recipe, the user's personal preference on food, and various contexts like what had been eaten in the past meals. In this work, we formulate the food recommendation problem as predicting user preference on recipes based on three key factors that determine a user's choice on food, namely, 1) the user's (and other users') history; 2) the ingredients of a recipe; and 3) the descriptive image of a recipe. To address this challenging problem, we develop a dedicated neural network based solution Hierarchical Attention based Food Recommendation (HAFR) which is capable of: 1) capturing the collaborative filtering effect like what similar users tend to eat; 2) inferring a user's preference at the ingredient level; and 3) learning user preference from the recipe's visual images. To evaluate our proposed method, we construct a large-scale dataset consisting of millions of ratings from AllRecipes.com. Extensive experiments show that our method outperforms several competing recommender solutions like Factorization Machine and Visual Bayesian Personalized Ranking with an average improvement of 12%, offering promising results in predicting user preference for food. Codes and dataset will be released upon acceptance.

研究の動機と目的

  • 既存の食品レコメンデーションシステムがレシピを原子的なアイテムとして扱い、ユーザーの好みに影響を与える多様な要因を無視するという限界を是正すること。
  • ユーザーとアイテムの相互作用、レシピの材料、食品画像からの視覚的意味を統合的にモデル化し、複雑な好みのパターンを捉えること。
  • 協調フィルタリング効果、材料レベルの好み、画像ベースの視覚的手がかりを捉える統一的なディープラーニングフレームワークを構築すること。
  • 食品推薦研究のための大規模で現実世界のデータセットを構築し、公開すること。
  • マルチモーダルおよび順序的な情報を統合することで、より正確でパーソナライズされた食品推薦を可能にすること。

提案手法

  • HAFRは階層的アテンション機構を用い、まず個々の材料を注目し、次にユーザーの相互作用履歴を注目することで、材料レベルでのユーザーの好みを捉える。
  • モデルはCNNベースの特徴抽出器を用いてレシピ画像を視覚的埋め込みに変換し、その後、材料表現および相互作用表現と統合する。
  • 二重アテンション機構が適用される:一つは材料レベルで各材料の重要性を重みづけ、もう一つはユーザーの行動履歴を集約する。
  • ユーザーおよびアイテムの表現は、協調フィルタリング信号、材料埋め込み、視覚的特徴をアテンションゲートを用いてマルチモーダル統合することで学習する。
  • ユーザーの好み予測を最適化するため、順序付き損失関数を用いてエンドツーエンドでモデルを訓練する。
  • 階層的構造により、ユーザー固有の好みに応じて材料や画像の寄与度を動的に重みづけることができる。

実験結果

リサーチクエスチョン

  • RQ1ユーザーの行動履歴、レシピの材料、視覚的画像特徴を統合することで、食品に対するユーザーの好みを効果的にモデル化する方法は何か?
  • RQ2階層的アテンションは、平坦なモデルや非アテンションモデルと比較して、レシピ表現の向上にどの程度寄与するか?
  • RQ3材料と視覚的特徴を同時にモデル化することで、それらを個別にモデル化する場合よりも推薦性能が向上するか?
  • RQ4協調フィルタリング信号とコンテンツベースの特徴(材料と画像)は、ユーザーの好み予測においてどのように相互作用するか?
  • RQ5提案されたHAFRモデルは、特定の材料や視覚的魅力に惹かれるユーザーの好みに対しても一般化可能か、特に多様なユーザーの嗜好に適応できるか?

主な発見

  • HAFRは、構築された大規模なデータセット上で、因子分解マシンやVisual Bayesian Personalized Rankingなどのベースラインモデルよりも平均12%の性能向上を達成した。
  • アブレーションスタディの結果、階層的アテンション機構が材料とユーザーの相互作用の両方を効果的に統合することで、性能が顕著に向上することが確認された。
  • 食品画像からの視覚的特徴の統合により、推薦精度に顕著な向上が見られ、視覚的意味が食品選択において重要な役割を果たすことが示された。
  • 材料や視覚的特徴を排除したモデルバージョンでは、性能が著しく低下し、3つの入力モodalitiyが相補的な価値を持つことが実証された。
  • モデルは、スパイシーな食品やシーフードが好きなユーザーの好みを、関連する材料や画像の手がかりに注目することで、効果的に捉えている。
  • 結果から、協調フィルタリング信号とコンテンツベースの特徴を組み合わせることで、単独で用いる場合よりも、より正確でパーソナライズされた推薦が得られることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。