Skip to main content
QUICK REVIEW

[论文解读] Beyond Cats and Dogs: Semi-supervised Classification of fuzzy labels with overclustering

Lars Schmarje, Johannes Brünger|arXiv (Cornell University)|Dec 3, 2020
Machine Learning and Data Classification参考文献 46被引用 8
一句话总结

本文提出了一种新颖的半监督框架——模糊过聚类(Fuzzy Overclustering, FOC),通过引入一种新的逆交叉熵损失函数,利用过聚类技术识别真实世界数据(如生物或医学图像)中模糊标签里的子结构。该方法实现了高达9倍的训练加速,预测一致性提升5–10%,并在STL-10和真实世界浮游生物数据集上均达到最先进性能。

ABSTRACT

A long-standing issue with deep learning is the need for large and consistently labeled datasets. Although the current research in semi-supervised learning can decrease the required amount of annotated data by a factor of 10 or even more, this line of research still uses distinct classes like cats and dogs. However, in the real-world we often encounter problems where different experts have different opinions, thus producing fuzzy labels. We propose a novel framework for handling semi-supervised classifications of such fuzzy labels. Our framework is based on the idea of overclustering to detect substructures in these fuzzy labels. We propose a novel loss to improve the overclustering capability of our framework and show on the common image classification dataset STL-10 that it is faster and has better overclustering performance than previous work. On a real-world plankton dataset, we illustrate the benefit of overclustering for fuzzy labels and show that we beat previous state-of-the-art semisupervised methods. Moreover, we acquire 5 to 10% more consistent predictions of substructures.

研究动机与目标

  • 为解决真实世界数据中标签模糊的问题,即专家意见不一致且标签无法清晰划分为独立类别。
  • 通过检测模糊数据中的有意义子结构而非强制将标签归入刚性类别,改进半监督学习。
  • 开发一种在具有模糊标签和偏态类别分布的数据集上优于现有半监督方法的框架。
  • 在保持或提升无标签数据上的过聚类性能的同时,缩短训练时间。

提出的方法

  • 该框架利用少量置信度高的已标注图像和大量模糊标签图像(视为无标签)进行半监督学习。
  • 采用过聚类技术检测模糊标签数据中的细粒度子结构,从而支持更一致的专家分析。
  • 提出一种新型损失函数——逆交叉熵,通过鼓励明确的聚类分配来提升过聚类性能。
  • 该方法采用多头架构,包含一个标准分类头和一个过聚类头,通过结合掩码任务、互信息损失和新型CE-1损失进行联合训练。
  • 对权重初始化进行了仔细评估,结果表明CIFAR-20的权重在STL-10上优于ImageNet权重,表明数据集特定的优化至关重要。
  • 该框架支持每轮训练中灵活限制数据使用量,与先前方法相比,将训练时间最多减少9倍。

实验结果

研究问题

  • RQ1在专家共识较低的真实世界模糊标签数据中,过聚类能否有效检测出子结构?
  • RQ2与标准损失相比,所提出的逆交叉熵损失在半监督学习中如何提升过聚类性能?
  • RQ3FOC在保持或提升模糊数据上分类与聚类准确率的同时,能在多大程度上缩短训练时间?
  • RQ4在具有模糊标签和偏态类别分布的数据集上,FOC是否优于SOTA半监督方法(如FixMatch)?
  • RQ5与以往方法相比,使用FOC时模糊数据中子结构的预测一致性提高了多少?

主要发现

  • FOC将STL-10的训练时间从数天缩短至数小时,通过每轮限制数据使用量,实现高达9倍的加速。
  • 在STL-10数据集上,FOC在完整损失设置下实现了70.57%的过聚类F1分数,比IIC高出超过11%的过聚类性能。
  • 在真实世界浮游生物数据集上,FOC实现了77.60%的过聚类F1分数,显著优于FixMatch及其他SOTA方法。
  • FOC使模糊标签的预测一致性提升5–10%,从而支持更可靠的下游专家分析。
  • 无论权重初始化方式如何,逆交叉熵损失(CE-1)在STL-10上将过聚类性能提升10%,在浮游生物数据集上提升达7%。
  • 即使使用较弱的初始化(CIFAR-20权重),FOC在STL-10上仍优于ImageNet预训练模型,表明损失函数可有效补偿次优初始化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。