Skip to main content
QUICK REVIEW

[论文解读] Completing partial recipes using item-based collaborative filtering to recommend ingredients

Paula Fermín Cueto, Meeke Roet|arXiv (Cornell University)|Jul 23, 2019
Recommender Systems and Techniques被引用 6
一句话总结

本文提出了一种基于物品的协同过滤方法,利用具有隐式反馈的稀疏高维食谱数据集,推荐部分食谱中缺失的食材。通过应用PMI相似度和基于PCA的降维,该方法在召回率@10上达到40.25%,即使在数据稀疏且缺乏显式评分的情况下,仍能实现有效且直观的食材推荐。

ABSTRACT

Increased public interest in healthy lifestyles has motivated the study of algorithms that encourage people to follow a healthy diet. Applying collaborative filtering to build recommendation systems in domains where only implicit feedback is available is also a rapidly growing research area. In this report we combine these two trends by developing a recommendation system to suggest ingredients that can be added to a partial recipe. We implement the item-based collaborative filtering algorithm using a high-dimensional, sparse dataset of recipes, which inherently contains only implicit feedback. We explore the effect of different similarity measures and dimensionality reduction on the quality of the recommendations, and find that our best method achieves a recall@10 of circa 40%.

研究动机与目标

  • 开发一种推荐系统,仅基于食谱-食材共现的隐式反馈,推荐完成部分食谱所需的食材。
  • 评估不同相似度度量方法与降维技术对稀疏高维数据集中推荐质量的影响。
  • 通过选择合适的相似度度量,解决隐式反馈中的挑战:即某食材未出现并不意味着用户不喜欢。
  • 通过基于PCA的降维提升模型的可扩展性与鲁棒性,同时保持高质量的推荐结果。
  • 将所提方法与现有基于矩阵分解的方法(如NNMF和RLS)在相同任务与数据集上的性能进行比较。

提出的方法

  • 将每道食谱视为一个'用户',每个食材视为一个'项目',将数据集转换为二值评分矩阵,其中1表示食材存在,0表示不存在。
  • 采用四种相似度度量方法(余弦相似度、非对称余弦相似度、Jaccard相似度和点互信息PMI)进行基于物品的协同过滤,以识别与部分食谱中食材频繁共现的其他食材。
  • 基于最相似的食材,使用k近邻(k=50)生成推荐结果,k值经过调优以确保鲁棒性。
  • 对食材空间应用主成分分析(PCA)进行降维,以减少稀疏性,并提升计算效率与稳定性。
  • 通过召回率@10、平均排名和中位数排名评估模型性能,以衡量推荐结果的精确性与排序质量。
  • 模型在包含39,774道食谱和6,782种不同食材的'What's Cooking?' Kaggle数据集上进行训练与测试,并通过预处理解决食材变体重复的问题。

实验结果

研究问题

  • RQ1在稀疏隐式反馈设置下,不同相似度度量方法(余弦、非对称余弦、Jaccard和PMI)如何影响食材推荐的质量?
  • RQ2通过PCA进行降维在高维稀疏食谱数据中在多大程度上提升了基于物品的协同过滤的鲁棒性与性能?
  • RQ3即使缺乏显式用户评分或菜系元数据,基于物品的协同过滤是否仍能生成直观且上下文相关的食材推荐?
  • RQ4k值(邻居数量)的选择如何影响不同相似度度量方法下推荐结果的稳定性与质量?
  • RQ5在相同任务与数据集上,所提方法与现有基于矩阵分解的方法(如NNMF和RLS)相比,性能如何?

主要发现

  • 表现最佳的方法是采用PMI相似度、k=50且经PCA降维的数据,其召回率@10达到40.25%,为所有评估相似度度量中的最高值。
  • 非对称余弦与PMI相似度在召回率@10与中位数排名上均优于标准余弦与Jaccard相似度,表明其对稀疏二值数据具有更好的处理能力。
  • 基于PCA的降维显著提升了推荐质量,运行时间缩短约10倍,并使结果对k值与相似度度量的变化更具鲁棒性。
  • 模型生成了直观且具有菜系意识的推荐,例如在墨西哥风味食材推荐中建议添加莎莎酱与玉米,即使未提供显式菜系信息。
  • 尽管缺乏显式反馈且存在数据质量问题(如'tortilla'与'corn tortilla'等重复食材),模型仍能生成合理且上下文相关的建议。
  • 与De Clercq等人提出的NNMF方法(召回率@10为43.6%)相比,本方法性能略低,但该差距归因于数据集的清洁度,表明通过数据预处理可能缩小甚至逆转这一差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。