Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Semi-supervised Learning for Data Labeling and Quality Evaluation

Haoping Bai, Meng Cao|arXiv (Cornell University)|Nov 22, 2021
Advanced Neural Network Applications参考文献 32被引用 7
一句话总结

本文提出了一种自监督半监督学习框架,通过对比表示学习和基于k近邻图的标签传播,实现高效的数据标注与在标签噪声下的鲁棒分类。通过使用BYOL进行无监督特征学习,并采用基于矩阵的标签传播方法,该方法在仅使用0.1%标注数据的情况下于CIFAR10上实现了97.0%的Top-1准确率,在50%标签噪声下也达到了97.4%的准确率,展示了其在主动学习和抗噪声标签方面的强大性能。

ABSTRACT

As the adoption of deep learning techniques in industrial applications grows with increasing speed and scale, successful deployment of deep learning models often hinges on the availability, volume, and quality of annotated data. In this paper, we tackle the problems of efficient data labeling and annotation verification under the human-in-the-loop setting. We showcase that the latest advancements in the field of self-supervised visual representation learning can lead to tools and methods that benefit the curation and engineering of natural image datasets, reducing annotation cost and increasing annotation quality. We propose a unifying framework by leveraging self-supervised semi-supervised learning and use it to construct workflows for data labeling and annotation verification tasks. We demonstrate the effectiveness of our workflows over existing methodologies. On active learning task, our method achieves 97.0% Top-1 Accuracy on CIFAR10 with 0.1% annotated data, and 83.9% Top-1 Accuracy on CIFAR100 with 10% annotated data. When learning with 50% of wrong labels, our method achieves 97.4% Top-1 Accuracy on CIFAR10 and 85.5% Top-1 Accuracy on CIFAR100.

研究动机与目标

  • 通过支持仅需极少标注数据的高效主动学习,降低工业深度学习流水线中的人工标注成本。
  • 通过自监督表示学习与标签传播检测并纠正标签错误,提升标注质量。
  • 通过利用最近邻图揭示的数据流形结构,实现高噪声标签下的鲁棒模型训练。
  • 设计一种可扩展且兼容实时处理的系统,通过避免昂贵的神经网络微调,实现人机协同的数据整理。
  • 为工业应用中的标签高效机器学习与数据整理建立一种简单而有效的基线方法。

提出的方法

  • 该方法使用BYOL(一种对比自监督学习框架)从无标签数据的增强视图中学习不变图像表征。
  • 利用学习到的表征作为相似性度量,构建稀疏的k近邻图,采用温度缩放的余弦相似度进行边权重分配。
  • 通过对称归一化的图拉普拉斯矩阵执行标签传播,利用迭代矩阵乘法将标签从已标注样本传播至未标注样本。
  • 通过利用最近邻图在数据流形上传播可靠标签信息,该框架同时支持主动学习与噪声标签修正。
  • 该方法通过使用预训练特征与高效的矩阵运算,避免重新训练深度网络,从而实现实时集成于人机协同系统中。
  • 通过网格搜索调整超参数(如k、T和学习率),骨干网络采用ViT-B/16,初始化使用BEiT预训练模型。

实验结果

研究问题

  • RQ1自监督表示学习与标签传播相结合,能否显著减少实现高模型准确率所需的标注样本数量?
  • RQ2在k-NN图上进行标签传播在多大程度上可纠正损坏标签,并在高标签噪声下维持模型性能?
  • RQ3与现有主动学习基线相比,该方法在标签效率与收敛速度方面表现如何?
  • RQ4由自监督特征构建的最近邻图是否保留了足够的数据结构,以支持在实时环境中的可靠标签传播?
  • RQ5该方法能否无缝集成到人机协同数据整理流水线中,而不牺牲吞吐量或需要模型微调?

主要发现

  • 在仅使用0.1%标注数据的情况下,该方法在CIFAR10上实现了97.0%的Top-1准确率,优于先前的主动学习方法。
  • 在CIFAR100上,使用10%标注数据时,该方法达到83.9%的Top-1准确率,展现出优异的标签效率。
  • 在50%标签噪声下,该方法在CIFAR10上保持97.4%的Top-1准确率,在CIFAR100上达到85.5%,表现出对标签污染的强鲁棒性。
  • 当一致性假设成立时,标签传播可在20次迭代内将伪标签中的噪声从0.8降低至0.2以下。
  • 消融实验表明,未标注数据显著提升了模型性能,当排除未标注数据生成的伪标签时,验证准确率大幅下降。
  • 使用学习表征的k-NN分类基线在CIFAR10上达到98.45%的Top-1准确率,在CIFAR100上达到89.58%,验证了自监督表征的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。