[论文解读] Multi-Task Image-Based Dietary Assessment for Food Recognition and Portion Size Estimation
本文提出了一种端到端的多任务深度学习框架,通过单张图像联合执行食物分类与份量大小估计,利用基于L2-范数的软参数共享以及归一化技术的跨域特征适应。该方法实现了最先进性能,将正确分类食物的平均绝对误差降低至50.86 Kcal,并在误差减少方面比人类估计高出28.57%。
Deep learning based methods have achieved impressive results in many applications for image-based diet assessment such as food classification and food portion size estimation. However, existing methods only focus on one task at a time, making it difficult to apply in real life when multiple tasks need to be processed together. In this work, we propose an end-to-end multi-task framework that can achieve both food classification and food portion size estimation. We introduce a food image dataset collected from a nutrition study where the groundtruth food portion is provided by registered dietitians. The multi-task learning uses L2-norm based soft parameter sharing to train the classification and regression tasks simultaneously. We also propose the use of cross-domain feature adaptation together with normalization to further improve the performance of food portion size estimation. Our results outperforms the baseline methods for both classification accuracy and mean absolute error for portion estimation, which shows great potential for advancing the field of image-based dietary assessment.
研究动机与目标
- 开发一种端到端的多任务学习框架,从单张图像中同时执行食物分类与份量大小估计。
- 解决现有单任务方法难以高效集成到现实世界饮食评估系统中的局限性。
- 通过跨域特征适应,利用食物分类知识提升份量大小估计的准确性。
- 探究归一化技术(LN、BN)在减少联合回归与分类任务误差方面的有效性。
- 构建并发布一个新的真实世界数据集,由注册营养师标注真实食物类别与份量大小。
提出的方法
- 采用基于L2-范数的软参数共享,对分类与回归网络的低层进行正则化,实现在不强制共享特征空间的前提下实现知识迁移。
- 通过拼接分类分支与回归分支的特征向量,实现跨域特征适应,利用食物类别先验知识提升份量估计性能。
- 采用层归一化(LN)与批量归一化(BN),对齐不同域的特征分布,提升回归性能。
- 使用Adam优化器在100个周期内训练基于18层ResNet的模型,采用余弦退火学习率调度与权重衰减。
- 引入一种新型评估指标MCCR(正确分类比例下的MAE),以平衡分类准确率与份量大小估计误差。
- 收集了一个新的进食场景数据集,由注册营养师提供真实份量大小标注,支持对份量估计进行真实场景评估。
实验结果
研究问题
- RQ1与单任务基线相比,多任务框架中的软参数共享是否能同时提升食物分类准确率与份量大小估计误差?
- RQ2分类与回归分支之间的跨域特征适应是否能提升份量大小估计性能?
- RQ3不同归一化技术(LN、BN、LN+BN)对多任务网络性能有何影响?
- RQ4所提出的多任务框架是否能在食物份量大小评估中超越人类估计?
- RQ5通过共享低层参数正则化的联合学习,在图像基饮食评估中在多大程度上提升了泛化能力?
主要发现
- 所提出的多任务框架在所有食物上的分类准确率达到88.67%,份量大小估计的平均绝对误差(MAE)为56.82 Kcal,优于单任务基线的86.08%与62.27 Kcal。
- 对于正确分类的食物,MAE降低至50.86 Kcal,证明了联合学习结合特征适应与归一化技术的优势。
- 采用LN+BN归一化策略取得了最佳性能,显著降低了MAE,相比单独使用归一化或不使用归一化。
- 结合归一化的跨域特征适应使MAE相比无归一化的特征拼接降低了11.5%,证明其在领域对齐中的有效性。
- 该方法优于人类估计,将误差百分比从人类的45.43%降低至模型的16.83%,表明其在份量大小估计中具有更高的准确性。
- MCCR指标证实,当分类正确时,模型的份量估计更为可靠,验证了多任务方法的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。