Skip to main content
QUICK REVIEW

[论文解读] Identifying Object States in Cooking-Related Images

Ahmad Babaeian Jelodar, Sirajus Salekin|arXiv (Cornell University)|May 17, 2018
Image Retrieval and Classification Techniques参考文献 21被引用 47
一句话总结

论文定义并解决在烹饪图像中识别对象状态的问题,构建了一个包含17个对象的11状态数据集,并提出基于ResNet的迁移学习模型,进行对每个对象的微调,在状态分类上取得良好性能,并实现对Imagenet子集的状态标注。

ABSTRACT

Understanding object states is as important as object recognition for robotic task planning and manipulation. To our knowledge, this paper explicitly introduces and addresses the state identification problem in cooking related images for the first time. In this paper, objects and ingredients in cooking videos are explored and the most frequent objects are analyzed. Eleven states from the most frequent cooking objects are examined and a dataset of images containing those objects and their states is created. As a solution to the state identification problem, a Resnet based deep model is proposed. The model is initialized with Imagenet weights and trained on the dataset of eleven classes. The trained state identification model is evaluated on a subset of the Imagenet dataset and state labels are provided using a combination of the model with manual checking. Moreover, an individual model is fine-tuned for each object in the dataset using the weights from the initially trained model and object-specific images, where significant improvement is demonstrated.

研究动机与目标

  • 定义用于烹饪对象的状态识别问题,以帮助更细粒度的活动理解和机器人操控。
  • 创建一个带标签的烹饪对象及11种状态的数据集。
  • 提出基于 ResNet 的迁移学习架构用于状态分类。
  • 展示对每个对象进行微调能够提升状态标签的准确性。
  • 在 Imagenet 的一个子集上演示对烹饪相关对象的状态标注。

提出的方法

  • 构建一个包含17种烹饪对象和11种状态(整体、去皮、裹粉、切片、切丁、磨碎、成细丝、榨汁、奶油状、混合、其他)的状态数据集。
  • 开发一个基于 ResNet 的网络,包含一个 1x1 的卷积层、两个卷积层和全局平均池化,之后接一个 11 类 softmax 用于状态分类。
  • 使用 Imagenet 预训练权重,初始阶段冻结基础网络,然后对整个网络进行微调。
  • 通过将最终层替换为与每个对象状态数量相匹配的 softmax,并进行四阶段的微调,执行面向对象的特定微调。
  • 使用在线数据增强、L2 正则化和批量归一化进行评估;并使用一个包含两个额外模型的投票集成。

实验结果

研究问题

  • RQ1烹饪图像中的对象可以处于哪些不同的状态,如何可靠地对它们进行分类?
  • RQ2与单一全局模型相比,对象级微调是否能提高状态识别的准确性?
  • RQ3状态识别模型在包含烹饪相关对象的 Imagenet 数据集中泛化能力如何?
  • RQ4该模型是否能够为超出自定义数据集的大规模图像数据集中的对象提供状态标签?

主要发现

  • 在不进行对象特定微调的情况下,完整状态数据集的状态识别准确率为 Top-1 80.4%(每类平均 81.4%)和 Top-2 91.5%,通过投票集成后提升至 82%。
  • 对象特定微调实现更高性能,在各对象上的平均 Top-1 为 86.9%、Top-2 为 88.3%(该实验中不包括面团)。
  • 在 Imagenet 子集上的评估在对 16 个烹饪相关对象类别标注 11 个状态时,达到 78.5% Top-1、89.6% Top-2 和 94.5% Top-3 的准确率。
  • 逐对象微调相较全局模型显著提升状态识别准确性(多个对象显示出显著提升,例如蘑菇 95.6% Top-1;在某些设置下胡萝卜 96% Top-1)。
  • 基于 Imagenet 的标注阶段给 16 个对象类别中的 800 张图像分配了状态标签,平均 78.5% Top-1、89.6% Top-2 和 94.5% Top-3。
  • 论文指出状态错误分类常来自多状态或模糊图像,建议未来在多状态检测和视频跟踪方面开展工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。