Skip to main content
QUICK REVIEW

[论文解读] ObjectLab: Automated Diagnosis of Mislabeled Images in Object Detection Data

Ulyana Tkachenko, Aditya Thyagarajan|arXiv (Cornell University)|Sep 2, 2023
Advanced Neural Network ApplicationsComputer Science被引用 3
一句话总结

ObjectLab 提出一种以数据为中心的方法,通过利用任何训练好的检测器的分布外预测,自动检测并优先处理目标检测数据集中错误标注的图像。它使用相似性度量和置信度分数识别三种错误类型——遗漏、定位不佳和标签互换,相较于现有标签质量评分方法,在多个数据集和模型上实现了更高的精确率和召回率。

ABSTRACT

Despite powering sensitive systems like autonomous vehicles, object detection remains fairly brittle in part due to annotation errors that plague most real-world training datasets. We propose ObjectLab, a straightforward algorithm to detect diverse errors in object detection labels, including: overlooked bounding boxes, badly located boxes, and incorrect class label assignments. ObjectLab utilizes any trained object detection model to score the label quality of each image, such that mislabeled images can be automatically prioritized for label review/correction. Properly handling erroneous data enables training a better version of the same object detection model, without any change in existing modeling code. Across different object detection datasets (including COCO) and different models (including Detectron-X101 and Faster-RCNN), ObjectLab consistently detects annotation errors with much better precision/recall compared to other label quality scores.

研究动机与目标

  • 为解决现实世界目标检测数据集中普遍存在的标注错误问题,这些错误会降低模型性能。
  • 开发一种通用的、与模型无关的方法,识别三种标签错误类型:遗漏、定位不佳和标签互换的边界框。
  • 通过基于模型预测分配标签质量分数,实现对图像进行标签审查的自动优先排序。
  • 在不修改模型架构或训练代码的前提下,通过数据修正提升目标检测性能。
  • 为以数据为中心的 AI 提供一种可扩展、可重用的解决方案,且在模型和训练策略不断演进时仍保持有效性。

提出的方法

  • ObjectLab 使用任何训练好的目标检测器的分布外预测,为每张图像评分标签质量,确保训练数据无泄露。
  • 为每张图像计算三种不同的标签质量分数:遗漏(针对缺失物体)、定位不佳(针对不精确边界框)和标签互换(针对错误类别标签)。
  • 对于定位不佳的分数,测量相同类别标注框与预测框之间的 IoU 相似度,若不存在此类预测则赋予最高分。
  • 对于标签互换的分数,识别出类别不同但与标注框高度相似的高置信度预测(≥0.95),当存在此类匹配时赋予较低分数。
  • 对于遗漏错误,评估无重叠标注框的高置信度预测(≥0.95),利用相似度和置信度估计遗漏标注的可能性。
  • 应用高斯核以避免相似度分数出现平局,固定超参数 α=σ=0.1,确保对微小 IoU 变化具有鲁棒性。

实验结果

研究问题

  • RQ1一种与模型无关、以数据为中心的方法是否能有效检测目标检测数据集中多种类型的标签错误,而无需修改模型训练过程?
  • RQ2ObjectLab 的标签质量评分方法在检测遗漏、定位不佳和标签互换错误方面,与现有方法相比在精确率和召回率上表现如何?
  • RQ3使用 ObjectLab 对标签审查进行优先排序,能在多大程度上提升相同目标检测模型的性能,而无需更改其架构或训练流程?
  • RQ4ObjectLab 在不同数据集(如 COCO)和模型(如 Faster R-CNN、Detectron-X101)上是否保持高性能?
  • RQ5与特定模型的噪声鲁棒训练技术相比,ObjectLab 的方法是否可推广至未来模型和训练策略?

主要发现

  • ObjectLab 在多个目标检测数据集(包括 COCO)上,无论在精确率还是召回率方面,均持续优于现有标签质量评分方法。
  • 该方法能以高置信度识别出遗漏的物体,例如在 COCO 图像中对一个被遗漏的消防栓,模型预测置信度高达 99.8%。
  • 对于标签互换错误,ObjectLab 检测出一个被错误标注为碗的玻璃杯,其对“杯子”类别的预测置信度达 96.2%,凸显其对类别标签不匹配的敏感性。
  • 在定位不佳的案例中,ObjectLab 识别出一个部分标注的桌子,其对更精确定位框的预测置信度达 96.4%,证实其检测空间不准确性的能力。
  • 使用分布外预测和基于相似度的评分策略,确保了在不同模型和数据集上的鲁棒性和泛化能力,且无需修改模型架构或训练代码。
  • ObjectLab 的方法可直接提升数据质量——通过修正错误标注的图像,可提升模型性能,而无需更改模型训练流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。