[论文解读] Training Subset Selection for Weak Supervision
本文提出了一种简单、即插即用的子集选择方法,用于弱监督学习,通过从弱标签数据中选择更高品质、高精确度的训练样本,提升模型准确率。该方法利用预训练表征和cut统计量,识别与最近邻一致的样本,无需真实标签,在多种数据集和模型上,性能最高可提升19%的绝对准确率。
Existing weak supervision approaches use all the data covered by weak signals to train a classifier. We show both theoretically and empirically that this is not always optimal. Intuitively, there is a tradeoff between the amount of weakly-labeled data and the precision of the weak labels. We explore this tradeoff by combining pretrained data representations with the cut statistic (Muhlenbach et al., 2004) to select (hopefully) high-quality subsets of the weakly-labeled training data. Subset selection applies to any label model and classifier and is very simple to plug in to existing weak supervision pipelines, requiring just a few lines of code. We show our subset selection method improves the performance of weak supervision for a wide range of label models, classifiers, and datasets. Using less weakly-labeled data improves the accuracy of weak supervision pipelines by up to 19% (absolute) on benchmark tasks.
研究动机与目标
- 为解决现有弱监督流水线中对所有弱标签数据使用不当的问题,这些数据通常包含低精确度样本。
- 探索弱监督中覆盖度(数据量)与精确度(标签质量)之间的权衡。
- 开发一种模块化、即插即用的方法,无需真实标签或修改现有标签模型和分类器,即可选择高质量的训练子集。
- 证明使用更小但更高精确度的弱标签数据子集,可提升下游分类器的性能。
提出的方法
- 该方法使用预训练表征(如BERT)将弱标签样本嵌入到潜在空间中。
- 应用cut统计量,识别那些具有相同伪标签且在表征空间中与其最近邻紧密连接的样本子集。
- cut统计量基于具有相同标签的邻居数量与预期随机性的对比计算得分,偏好预测一致的簇。
- 根据覆盖率超参数β,选择得分最高的部分样本作为最终训练子集。
- 该方法具有模块化特性,可插入标签模型输出与最终模型训练之间,兼容任意标签模型和分类器。
- 仅需少量代码即可集成到现有弱监督流水线中,例如Snorkel或ASTRA。
实验结果
研究问题
- RQ1在弱监督流水线中使用所有弱标签数据是否会导致因标签噪声而性能不佳?
- RQ2通过优先选择高精确度样本而非高覆盖度样本的数据选择方法,能否提升弱监督性能?
- RQ3cut统计量能否在无真实标签访问的情况下有效识别高质量训练子集?
- RQ4与全量数据训练相比,通过cut统计量进行子集选择在多种数据集、标签模型和分类器上的表现如何?
- RQ5该方法能否有效集成到如ASTRA等迭代式弱监督框架中?
主要发现
- 所提出的子集选择方法在基准任务上将弱监督准确率最高提升19%的绝对值,表现出显著的性能增益。
- 在TREC和SemEval数据集上,将cut统计量与ASTRA结合后,使用10个标注样本时准确率从82.70%提升至91.10%,使用20个标注样本时从86.53%提升至90.27%。
- 该方法在多个数据集和模型上持续优于全量数据训练,即使未对覆盖率超参数β进行调优。
- cut统计量通过利用预训练表征的几何结构,有效识别出高质量子集,偏好那些其伪标签与其最近邻一致的样本。
- 该方法具有模块化特性,兼容任意标签模型和分类器,仅需极少代码修改即可集成到现有流水线中。
- 性能增益在不同随机种子和超参数设置下均具鲁棒性,即使β固定且未在验证集上调优,仍可观察到性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。