Skip to main content
QUICK REVIEW

[论文解读] LOST: A flexible framework for semi-automatic image annotation

Jonas Jäger, Gereon Reus|arXiv (Cornell University)|Oct 16, 2019
Advanced Image and Video Retrieval Techniques参考文献 26被引用 4
一句话总结

LOST 是一种灵活的开源框架,用于半自动图像标注,使研究人员能够设计并执行可自定义的标注流水线,整合多种工具和机器学习模型。通过集成目标检测建议和基于聚类的标签分配,其将标注时间最多减少一半,并在迭代优化过程中保持较高的标注质量(mAP ~80%),优于后期迭代中的单阶段标注。

ABSTRACT

State-of-the-art computer vision approaches rely on huge amounts of annotated data. The collection of such data is a time consuming process since it is mainly performed by humans. The literature shows that semi-automatic annotation approaches can significantly speed up the annotation process by the automatic generation of annotation proposals to support the annotator. In this paper we present a framework that allows for a quick and flexible design of semi-automatic annotation pipelines. We show that a good design of the process will speed up the collection of annotations. Our contribution is a new approach to image annotation that allows for the combination of different annotation tools and machine learning algorithms in one process. We further present potential applications of our approach. The source code of our framework called LOST (Label Objects and Save Time) is available at: https://github.com/l3p-cv/lost.

研究动机与目标

  • 解决计算机视觉研究中手动图像标注带来的高时间成本问题。
  • 支持灵活、可组合的工作流,整合多样化的标注工具和机器学习模型。
  • 通过将任务划分为简单阶段和专家阶段,减少专家标注时间。
  • 支持迭代式、自我改进的标注流水线,随时间推移不断优化模型。
  • 提供可重用、开源的框架,支持可扩展和协作的数据集构建。

提出的方法

  • LOST 将标注建模为可通过基于 Web 的界面配置的流水线,采用模块化组件。
  • 通过集成目标检测(RetinaNet)和特征嵌入(ResNet50)生成边界框和类别建议。
  • 采用两阶段循环:第一阶段,提出并绘制边界框;第二阶段,通过 MIA(多图像标注)界面对框的聚类进行标签分配。
  • 通过在每次循环迭代后使用新标注数据微调模型(RetinaNet、ResNet50),支持迭代优化。
  • LOST 允许注入自定义 Python 脚本,以完全控制流水线逻辑和数据流。
  • 系统可通过 Docker 本地部署,或作为基于云的协作平台使用。

实验结果

研究问题

  • RQ1灵活且可组合的框架是否能在保持高质量标签的同时减少标注时间?
  • RQ2与单阶段手动标注相比,迭代式、模型引导的标注在时间和准确性方面表现如何?
  • RQ3聚类和批量标注(通过 MIA)在多大程度上能减少专家标注工作量?
  • RQ4带有反馈回路的自我改进流水线是否能随时间保持或提升标注质量?
  • RQ5将工作划分为简单任务(建议验证)和专家任务(标签分配)在多大程度上有效?

主要发现

  • 在后期迭代中,循环式两阶段标注方法将每个框的平均标注时间减少了两倍,相比单阶段标注。
  • 标注质量保持稳定在约 80% mAP,标准差为 4.3%,反映出标注者注意力和图像难度的影响。
  • RetinaNet 的检测性能在迭代过程中持续提升,在 Pascal VOC 2007 上达到 58% mAP,接近完全监督模型的 66% mAP。
  • MIA 界面实现了基于聚类的标签分配,与逐框标注相比,类别标注时间最多减少 50%。
  • 该框架实现了有效的任务分工:简单框绘制与专家标签分配分离,降低了对专家时间的依赖。
  • 在休息时段(如夜间)训练模型,使计算开销在实际应用中可忽略不计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。