[论文解读] Combining Weakly and Webly Supervised Learning for Classifying Food Images
该论文提出一种混合方法,结合网页弱监督学习与弱监督学习(WSL),通过极少的人工校对提升食物图像分类性能。通过将少量人工校对的数据逐步整合进大规模噪声网页数据中,并应用WSL定位判别性区域,该方法实现了76.2%的top-1准确率,显著优于仅使用校对数据(63.3%)或仅使用网页数据(50.3%)训练的模型。
Food classification from images is a fine-grained classification problem. Manual curation of food images is cost, time and scalability prohibitive. On the other hand, web data is available freely but contains noise. In this paper, we address the problem of classifying food images with minimal data curation. We also tackle a key problems with food images from the web where they often have multiple cooccuring food types but are weakly labeled with a single label. We first demonstrate that by sequentially adding a few manually curated samples to a larger uncurated dataset from two web sources, the top-1 classification accuracy increases from 50.3% to 72.8%. To tackle the issue of weak labels, we augment the deep model with Weakly Supervised learning (WSL) that results in an increase in performance to 76.2%. Finally, we show some qualitative results to provide insights into the performance improvements using the proposed ideas.
研究动机与目标
- 解决人工校对食物图像数据集在细粒度分类中成本高且难以扩展的问题。
- 应对食物图像分类中噪声大、多食物共现及弱标签网页数据的挑战。
- 通过结合有限的人工校对数据与大规模未校对网页数据,提升分类准确率。
- 利用弱监督学习(WSL)定位判别性区域,减少视觉上相似食物类别之间的混淆。
- 证明性能随校对数据量增加呈线性提升,且WSL能增强泛化能力与定位准确率。
提出的方法
- 从搜索引擎(如Google Images)收集未校对的网页数据,构建大规模、含噪声的训练集。
- 将少量人工校对的图像按顺序逐步整合进网页数据中,实现模型性能的渐进式提升。
- 对深度神经网络应用弱监督学习(WSL),仅使用图像级别标签,实现激活图生成以实现定位。
- 利用WSL生成的类别激活图(CAMs)识别并聚焦于食物项目中的判别性区域,即使在多食物共现的图像中亦可实现。
- 在整合数据集(校对数据 + 网页数据)上端到端训练深度学习模型,并采用WSL监督,以提升泛化能力并减少类别间噪声影响。
- 使用UEC256测试集上的top-1与top-5准确率评估性能,并对定位图进行定性分析。
实验结果
研究问题
- RQ1将少量人工校对数据与大规模网页数据结合,是否能相比单独使用任一数据源显著提升食物图像分类准确率?
- RQ2在噪声大、多食物共现及弱标签网页数据上训练时,弱监督学习(WSL)的整合如何提升模型性能?
- RQ3WSL在视觉上相似类别(如味噌汤与巧克力蛋糕)中,对判别性食物区域的定位改善程度如何?
- RQ4训练集与测试集间的数据分布偏移(如不同菜系)如何影响模型泛化能力与误分类率?
- RQ5在多食物场景下,WSL的失败模式是什么?其对top-1与top-5预测性能的影响如何?
主要发现
- 仅使用网页数据时top-1准确率为50.3%,加入少量人工校对数据后提升至72.8%,表明校对带来线性性能增益。
- 进一步整合弱监督学习(WSL)后,top-1准确率提升至76.2%,优于仅使用校对数据训练的模型(63.3%)。
- WSL通过激活图实现对食物项目的近似定位,有助于区分视觉上相似的类别(如味噌汤与巧克力蛋糕)。
- top-5准确率达到90.8%,表明即使top-1预测错误,正确标签通常也位于top-5预测中,尤其在部分遮挡或共现食物情况下表现良好。
- 模型有时会将共现食物项目(如鸡肉与米饭)一并定位,或聚焦于非目标项(如酱汁而非御馔),揭示了标准WSL在多目标场景下的局限性。
- 误分类常由分布偏移(如测试集中出现的日本菜系在训练集中未见)或类别间相似性(如薯条与炸鱼薯条)引起,而WSL通过定位能力有效缓解了此类问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。