[论文解读] Food Ingredients Recognition through Multi-label Learning
本文提出一种使用微调卷积神经网络(InceptionV3 和 ResNet50)的多标签深度学习方法,用于从图像中识别食物成分,即使在未见过的食谱中也能实现识别。该方法通过在多样化数据集上进行训练,实现了强大的泛化能力,可视化了神经元对特定成分的特化行为,并发布了两个用于食物成分识别研究的新数据集。
Automatically constructing a food diary that tracks the ingredients consumed can help people follow a healthy diet. We tackle the problem of food ingredients recognition as a multi-label learning problem. We propose a method for adapting a highly performing state of the art CNN in order to act as a multi-label predictor for learning recipes in terms of their list of ingredients. We prove that our model is able to, given a picture, predict its list of ingredients, even if the recipe corresponding to the picture has never been seen by the model. We make public two new datasets suitable for this purpose. Furthermore, we prove that a model trained with a high variability of recipes and ingredients is able to generalize better on new data, and visualize how it specializes each of its neurons to different ingredients.
研究动机与目标
- 解决在图像中识别食物成分的挑战,特别是当成分在视觉上模糊或不可见时。
- 克服现有食物识别系统在未见过的食谱上泛化能力不足的局限。
- 开发一种方法,能够在训练过程中未见过的菜肴中预测其成分,利用多标签学习。
- 创建并发布两个新数据集,以支持食物成分识别领域的研究。
- 通过可视化技术探究深度神经网络神经元如何特化以检测特定成分。
提出的方法
- 使用交叉熵损失函数,对预训练的 ImageNet 模型(InceptionV3 和 ResNet50)进行微调,以实现多标签分类。
- 将卷积神经网络的最后全连接层调整为输出一个二值向量,表示每个成分的有无状态。
- 在包含食物图像及其成分列表配对的多样化数据集上训练模型,以提升泛化能力。
- 应用可视化技术以解释神经元激活情况,并分析哪些成分是特定神经元所特化的检测目标。
- 使用两个数据集:Ingredients101(101种成分,10,000张图像)和 Recipes5k(5,000道食谱,50,000张图像),其中包含细粒度和简化的成分列表。
- 使用 F1 分数、精确率和召回率评估模型性能,并对比在已见和未见数据上的结果。
实验结果
研究问题
- RQ1多标签深度学习模型能否泛化到识别其在训练过程中从未见过的食谱中的成分?
- RQ2在成分和食谱变化较大的数据集上进行训练,如何影响模型的泛化性能?
- RQ3卷积神经网络中的单个神经元在成分不明显的情况下,能在多大程度上特化以检测特定成分?
- RQ4模型能否仅基于视觉外观推断出不可见或细微表示的成分的存在?
- RQ5在训练和评估过程中简化成分列表,如何影响模型的性能和鲁棒性?
主要发现
- 当在多样化 Ingredients101 数据集上进行训练时,该模型在未见过的 Recipes5k 简化数据集上实现了出色的泛化性能,F1 分数超过 40%。
- 在高变异性数据集(如 Ingredients101)上训练的模型,相比在有限或特定数据上训练的模型,其在新食谱上的泛化能力显著更强。
- 神经元激活的可视化结果表明,特定神经元会特化检测特定成分——例如,在汉堡中对‘生菜’或‘番茄酱’有响应的神经元,或在焦焦布丁等甜点中对‘糖’有响应的神经元。
- 该模型学习了成分的语义嵌入,使其能够将语义相关的细粒度变体(如‘鸡蛋’和‘打散的鸡蛋’)作为一个整体进行预测,即使在真实标签中仅出现其中一种变体。
- 该模型能够基于视觉线索成功推断出不可见成分(如在烤制甜点中推断出‘糖’的存在),展示了对成分组成的强大抽象能力。
- 在训练过程中简化成分列表可将 F1 分数提升至 47.5%,表明降低标签复杂度可提升模型性能,同时不损害其细粒度识别能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。