[论文解读] Learning to Taste: A Multimodal Wine Dataset
本文介绍了WineSensed,一个大规模多模态葡萄酒数据集,整合了897,000张葡萄酒标签图像、824,000条用户评论,以及来自众包品酒研究的5,000多个成对风味相似性标注。该研究提出FEAST(基于标注相似性与文本-图像的风味嵌入),一种将图像、文本和风味数据融合到低维空间的共享嵌入模型,在与人类风味感知对齐以及粗粒度风味分类任务中的性能显著提升。
We present WineSensed, a large multimodal wine dataset for studying the relations between visual perception, language, and flavor. The dataset encompasses 897k images of wine labels and 824k reviews of wines curated from the Vivino platform. It has over 350k unique bottlings, annotated with year, region, rating, alcohol percentage, price, and grape composition. We obtained fine-grained flavor annotations on a subset by conducting a wine-tasting experiment with 256 participants who were asked to rank wines based on their similarity in flavor, resulting in more than 5k pairwise flavor distances. We propose a low-dimensional concept embedding algorithm that combines human experience with automatic machine similarity kernels. We demonstrate that this shared concept embedding space improves upon separate embedding spaces for coarse flavor classification (alcohol percentage, country, grape, price, rating) and aligns with the intricate human perception of flavor.
研究动机与目标
- 通过创建一个丰富、多模态的数据集,弥合机器学习与食品科学之间的差距,以建模葡萄酒中的人类风味感知。
- 通过使用Napping方法的大规模感官研究,捕捉人类风味感知的细微差别。
- 开发一个共享嵌入空间,整合视觉、文本和风味模态,以提升下游分类任务和感知对齐性能。
- 验证风味标注是否能超越传统属性(如葡萄品种、价格和评分)在多模态表征学习中的增益作用。
提出的方法
- 组织了256名参与者参与的大规模Napping研究,收集了100多款葡萄酒之间的成对风味相似性判断。
- 使用Harris角点检测和单应性投影技术,将纸质标注表数字化,以提取葡萄酒位置之间的像素级距离。
- 将贴纸的颜色映射到葡萄酒身份,并计算欧几里得距离作为风味相似性得分。
- 提出FEAST(基于标注相似性与文本-图像的风味嵌入),一种结合人工标注风味距离与视觉-语言嵌入的低维概念嵌入算法。
- 通过成对距离作为监督信号,训练模型以对齐图像和文本嵌入与人工标注的风味空间。
- 利用预训练的多模态模型提取葡萄酒标签图像和用户评论中的语义与结构特征,并将其与风味嵌入融合。
实验结果
研究问题
- RQ1共享的多模态嵌入空间是否能提升对酒精含量、葡萄品种和原产国等粗粒度风味概念的建模能力?
- RQ2将人工标注的风味相似性数据纳入模型,是否能增强机器表征与人类味觉感知之间的对齐?
- RQ3图像、文本和风味标注等不同模态数据如何协同作用,以学习更准确的风味表征?
- RQ4使用成对风味距离进行训练,是否比使用序数排名更有效于学习风味感知表征?
主要发现
- 使用成对风味距离(而非序数排名)显著提升了学习到的风味表征质量,验证了标注方法的有效性。
- 多模态数据(图像、文本和风味标注)的整合在下游分类任务中带来了显著的性能提升。
- 所提出的FEAST模型与人类对风味的感知高度对齐,表明共享嵌入空间能够捕捉复杂的感官关系。
- 该模型成功地在共享嵌入空间中编码了葡萄成分、酒精含量和原产国等粗粒度风味概念。
- 数据集和预处理流程已以知识共享署名4.0国际许可(Creative Commons Attribution 4.0)公开,支持广泛重用与扩展。
- 未实施数据保留或同意撤回机制,因为数据集已完全匿名化,无法追溯至个人。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。