[论文解读] Weakly Supervised Active Learning with Cluster Annotation
本文提出了一种弱监督主动学习框架,通过允许专家对相似图像的整个聚类进行标注,而非对单个样本进行标注,从而减少人工标注的工作量。通过结合不确定性采样与聚类标注,该方法在CIFAR-10上将人工交互减少82%,在EuroSAT上减少87%,同时达到与完全监督学习相当的测试准确率。
In this work, we introduce a novel framework that employs cluster annotation to boost active learning by reducing the number of human interactions required to train deep neural networks. Instead of annotating single samples individually, humans can also label clusters, producing a higher number of annotated samples with the cost of a small label error. Our experiments show that the proposed framework requires 82% and 87% less human interactions for CIFAR-10 and EuroSAT datasets respectively when compared with the fully-supervised training while maintaining similar performance on the test set.
研究动机与目标
- 通过最小化个体标注交互次数,降低深度学习中人工数据标注的高昂成本。
- 通过利用聚类将相似样本分组,解决主动学习在大规模数据集上扩展的挑战。
- 通过允许专家对带有轻微标签噪声的聚类进行标注,在不牺牲模型性能的前提下提升标注效率。
- 证明结合不确定性采样与聚类标注可获得优于单独使用任一方法的性能与效率。
提出的方法
- 将聚类整合到基于池的主动学习流程中,基于预训练CNN的特征嵌入将未标注样本分组为聚类。
- 向人类专家展示聚类进行标注,假设聚类内部类一致性成立,从而减少所需的个体标注次数。
- 采用混合标注策略,交替或结合基于不确定性的样本选择与聚类标注,以提升模型性能。
- 使用单一深度神经网络完成特征提取与分类,避免额外的训练开销。
- 通过优先选择不确定样本以清理聚类后再进行聚类标注,优化标注顺序,降低标签噪声。
- 使用代表性样本可视化聚类,以辅助专家标注,兼顾清晰度与覆盖范围。
实验结果
研究问题
- RQ1聚类标注能否显著减少训练深度神经网络所需的人员交互次数?
- RQ2将不确定性采样与聚类标注结合使用时,与单独使用任一方法相比,对模型性能有何影响?
- RQ3标注顺序(先不确定性后聚类 vs. 先聚类后不确定性)对标签错误率与模型准确率有何影响?
- RQ4在大幅减少标注样本数量的情况下,聚类标注在多大程度上能维持与完全监督学习相当的性能?
主要发现
- 与完全监督训练相比,该框架在CIFAR-10上将人工交互减少82%,在EuroSAT上减少87%,同时达到相似的测试准确率。
- 先不确定后聚类的标注顺序优于先聚类后不确定及其他基线方法,在两个数据集上均取得最高的测试准确率。
- 当先标注不确定样本时,聚类标注样本的标签错误率显著降低,表明聚类质量得到提升。
- 结合不确定性与聚类标注的场景标注的图像总数最多,但性能提升受限于更高的标签噪声。
- 在仅9,000次(18%)和2,800次(13%)人工交互下,该框架在CIFAR-10上达到0.950±0.003的测试准确率,在EuroSAT上达到0.973±0.001,与完全监督学习性能相当。
- 仅使用聚类的策略早期即出现性能停滞,凸显了持续进行基于不确定性的采样对维持性能提升的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。