[论文解读] Exploiting Context for Robustness to Label Noise in Active Learning
该论文提出了一种上下文感知的噪声标签检测(CNLD)方法,用于在标签噪声存在的情况下实现鲁棒的多分类主动学习。通过图表示建模数据点之间的相互关系,并将新引入的标签关系与先验关系知识进行比较,该方法利用不相似度分数检测错误标签,在场景分类、动作分类和文档分类任务中即使存在噪声标注,也能显著提升识别准确率。
Several works in computer vision have demonstrated the effectiveness of active learning for adapting the recognition model when new unlabeled data becomes available. Most of these works consider that labels obtained from the annotator are correct. However, in a practical scenario, as the quality of the labels depends on the annotator, some of the labels might be wrong, which results in degraded recognition performance. In this paper, we address the problems of i) how a system can identify which of the queried labels are wrong and ii) how a multi-class active learning system can be adapted to minimize the negative impact of label noise. Towards solving the problems, we propose a noisy label filtering based learning approach where the inter-relationship (context) that is quite common in natural data is utilized to detect the wrong labels. We construct a graphical representation of the unlabeled data to encode these relationships and obtain new beliefs on the graph when noisy labels are available. Comparing the new beliefs with the prior relational information, we generate a dissimilarity score to detect the incorrect labels and update the recognition model with correct labels which result in better recognition performance. This is demonstrated in three different applications: scene classification, activity classification, and document classification.
研究动机与目标
- 解决主动学习中标签噪声的严峻挑战,因为标注者差异常导致人工标注标签错误。
- 开发一种方法,用于检测哪些查询标签可能不正确,尤其在主流研究集中于二分类的多分类场景中。
- 形式化一个集成噪声标签检测的主动学习框架,以在存在不可靠标注的情况下提升模型的鲁棒性和性能。
- 实现在缺乏多标注者且标签质量不确定的低资源和大规模场景中的有效学习。
提出的方法
- 构建未标注数据的图表示,以编码数据点之间的上下文关系,如物体-场景或动作-动作的共现关系。
- 利用初始种子模型的先验关系信息,定义类别之间的预期关系,作为一致性检查的基线。
- 在图上执行条件推理,当引入噪声标签时计算新的边信念,捕捉更新后的关系结构。
- 计算先验与更新后关系信念之间的不相似度分数,量化不一致性,识别明显偏离预期上下文的标签。
- 过滤掉不相似度分数较高的标签(可能错误),仅使用高置信度、上下文一致的标签更新分类模型。
- 将CNLD集成到主动学习流水线中,结合人工验证标签和伪标签数据,通过去除噪声伪标签提升性能。
实验结果
研究问题
- RQ1在标签噪声普遍且标注者非专家的多分类主动学习设置中,如何检测错误标签?
- RQ2在多分类场景中,数据点之间的上下文关系在多大程度上可被用于识别不一致或噪声标签?
- RQ3上下文感知的标签过滤机制是否能在不同视觉和文本分类任务中,有效提升标签噪声存在下的识别性能?
- RQ4当存在噪声标签时,所提框架的性能与标准主动学习和伪标签方法相比如何?
主要发现
- 在高噪声率(Ω = 0.50)下,与基线主动学习相比,CNLD方法在场景分类中实现1.0%至3.81%的绝对准确率提升,在文档分类中最高提升达6.51%。
- 在动作分类任务中,高噪声率下该方法实现1.21%至4.25%的绝对准确率增益,表明其在不同数据模态下的鲁棒性。
- 使用CNLD过滤伪标签可显著提升性能,优于直接伪标签方法,最佳效果出现在文档分类和场景分类任务中。
- 该框架在多种应用中保持高性能——包括场景、动作和文档分类,证明其泛化能力以及对特定特征或分类器的独立性。
- 在高噪声条件下,控制标签检测中精确率-召回率权衡的β参数在广泛取值范围(β ∈ {0.80, 0.85, 0.90})内均表现出一致的性能增益。
- 定性结果证实,低不相似度分数与正确标签强相关,验证了该方法检测上下文不一致标签的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。