Skip to main content
QUICK REVIEW

[论文解读] Ambiguous Annotations: When is a Pedestrian not a Pedestrian?

Luisa Schwirten, Jannes Scholz|arXiv (Cornell University)|May 14, 2024
Safety Warnings and SignagePsychology被引用 3
一句话总结

本文提出一种方法,通过使用基于标注者意见分歧的可量化模糊度度量,识别并从训练数据中移除高度模糊的标注,以提升行人检测模型的性能。通过修剪模糊实例,作者在减少训练时间和标注成本的同时,实现了mAP、LAMR、精确率和F1分数的提升。

ABSTRACT

Datasets labelled by human annotators are widely used in the training and testing of machine learning models. In recent years, researchers are increasingly paying attention to label quality. However, it is not always possible to objectively determine whether an assigned label is correct or not. The present work investigates this ambiguity in the annotation of autonomous driving datasets as an important dimension of data quality. Our experiments show that excluding highly ambiguous data from the training improves model performance of a state-of-the-art pedestrian detector in terms of LAMR, precision and F1 score, thereby saving training time and annotation costs. Furthermore, we demonstrate that, in order to safely remove ambiguous instances and ensure the retained representativeness of the training data, an understanding of the properties of the dataset and class under investigation is crucial.

研究动机与目标

  • 研究人类标注的自动驾驶数据集中模糊性作为数据质量关键维度的影响。
  • 评估移除高度模糊标注是否能提升最先进行人检测器的性能。
  • 通过识别并排除标签一致性较低的实例,降低训练和标注成本。
  • 在修剪模糊数据时,通过有根据的数据筛选确保数据集的代表性不受影响。

提出的方法

  • 基于多名标注者对同一实例分配标签的频率分布,使用启发式度量方法量化模糊度。
  • 采用基于阈值的修剪策略,从训练集中移除模糊度得分较高的实例。
  • 在原始数据集和修剪后数据集上分别训练最先进行人检测器,进行对比评估。
  • 可视化并分析不同类别和属性(如遮挡、模糊)下的模糊度分布,识别意见分歧的常见来源。
  • 利用遮挡标签和视觉检查验证模糊度与已知挑战性图像属性之间的关系。
  • 在修剪可能损害数据集代表性时,调整数据收集或增强策略。

实验结果

研究问题

  • RQ1模糊标注的存在如何影响行人检测模型的性能?
  • RQ2移除高度模糊实例是否能提升LAMR、精确率和F1分数等模型指标?
  • RQ3模糊度与已知的图像级挑战(如遮挡或模糊)之间存在何种关系?
  • RQ4如何量化模糊度并用于指导数据修剪,同时不牺牲数据集的代表性?
  • RQ5在移除模糊数据时,特别是在召回率、精确率和泛化能力方面,会引发哪些权衡?

主要发现

  • 从训练集中移除高度模糊实例后,行人检测器在大多数评估子集上的LAMR、精确率和F1分数均得到提升。
  • 在非遮挡子集上,基于修剪数据训练的模型表现优于基线模型,表明其在清晰样本上的泛化能力得到改善。
  • 在遮挡子集上,基于完整数据集训练的模型表现更优,证实了模糊实例在遮挡样本中占比较高。
  • 高模糊度得分与遮挡标签存在强相关性,遮挡出现率在模糊度得分为0.79时达到峰值。
  • 修剪模糊数据显著减少了训练时间和标注成本,尤其当高模糊度实例从标注流程中完全排除时效果更明显。
  • 本研究表明,模糊度并非噪声,而是数据的结构性特征,必须通过系统化数据筛选加以管理,以维持模型的鲁棒性和效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。