[论文解读] Long-Tailed Continual Learning For Visual Food Recognition
本文提出了一种用于视觉食物识别中长尾持续学习的端到端框架,结合基于特征的知识蒸馏与双预测头机制,以缓解灾难性遗忘,并采用CAM-CutMix数据增强技术提升罕见食物类别的泛化能力。该方法在Food101-LT、VFN-LT、VFN-INSULIN和VFN-T2D基准上实现了显著的准确率提升,在长尾、增量学习场景下优于现有方法。
Deep learning-based food recognition has made significant progress in predicting food types from eating occasion images. However, two key challenges hinder real-world deployment: (1) continuously learning new food classes without forgetting previously learned ones, and (2) handling the long-tailed distribution of food images, where a few common classes and many more rare classes. To address these, food recognition methods should focus on long-tailed continual learning. In this work, We introduce a dataset that encompasses 186 American foods along with comprehensive annotations. We also introduce three new benchmark datasets, VFN186-LT, VFN186-INSULIN and VFN186-T2D, which reflect real-world food consumption for healthy populations, insulin takers and individuals with type 2 diabetes without taking insulin. We propose a novel end-to-end framework that improves the generalization ability for instance-rare food classes using a knowledge distillation-based predictor to avoid misalignment of representation during continual learning. Additionally, we introduce an augmentation technique by integrating class-activation-map (CAM) and CutMix to improve generalization on instance-rare food classes. Our method, evaluated on Food101-LT, VFN-LT, VFN186-LT, VFN186-INSULIN, and VFN186-T2DM, shows significant improvements over existing methods. An ablation study highlights further performance enhancements, demonstrating its potential for real-world food recognition applications.
研究动机与目标
- 解决在长尾数据分布下,持续食物识别中灾难性遗忘与类别不平衡的双重挑战。
- 构建反映2型糖尿病患者和胰岛素使用者真实食物消费模式的现实基准数据集。
- 设计一种端到端学习框架,有效保留先前学习过的食物类别的知识,同时适应新的、罕见的食物类别。
- 通过创新的数据增强与表征蒸馏技术,提升对实例罕见食物类别的泛化能力。
- 在多个长尾数据集上评估该方法,包括新提出的VFN-INSULIN与VFN-T2D,以证明其鲁棒性与现实世界适用性。
提出的方法
- 在知识蒸馏中引入双预测头机制,将当前特征表示回映射到过去类别空间,减少持续学习过程中特征空间的错位。
- 采用基于特征的知识蒸馏,利用学生-教师框架,使学生模型从当前和过去类别表示中学习。
- 提出一种新颖的数据增强策略,结合类别激活图(CAM)与CutMix,突出罕见食物类别的判别区域,增强特征学习。
- 使用记忆缓冲区存储支持样本图像以实现知识保留,并通过消融实验研究缓冲区容量对可扩展性与隐私权衡的影响。
- 在ImageNet-1K与ImageNet-21K上使用预训练主干网络(如ResNet、EfficientNet、ViT)以改善持续学习前的初始特征表示。
- 采用增量训练策略,仅在新类别上更新模型,同时通过蒸馏与基于支持样本的正则化保持对先前见过类别的性能。
实验结果
研究问题
- RQ1在视觉食物识别的长尾持续学习中,如何有效缓解灾难性遗忘?
- RQ2将基于CAM的注意力与CutMix结合,在长尾分布下对罕见食物类别的泛化能力提升程度如何?
- RQ3所提出的双预测头机制在增量学习各阶段如何改善表征对齐?
- RQ4记忆缓冲区大小对长尾持续学习性能的影响如何?性能在何处趋于饱和?
- RQ5在大规模数据集上预训练的主干网络对长尾持续食物识别的下游性能有何影响?
主要发现
- 所提方法在Food101-LT、VFN-LT、VFN-INSULIN与VFN-T2D基准上,相较于现有方法在平均准确率上实现了显著提升。
- 随着记忆缓冲区容量增加,性能持续提升,但超过50个支持样本后性能趋于饱和,表明类别不平衡与遗忘构成性能瓶颈。
- 与从零开始训练相比,在ImageNet-1K与ImageNet-21K上预训练可使平均准确率提升超过20%,凸显强初始表征的重要性。
- CAM-CutMix增强技术显著提升了对实例罕见食物类别的泛化能力,尤其在长尾设置下表现突出。
- 消融实验证实,双预测头与CAM-CutMix增强均为关键组件,二者对整体性能均有显著贡献。
- 该框架在多种现实世界食物消费模式下表现出强鲁棒性,包括针对糖尿病患者与胰岛素依赖人群的特定模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。