[论文解读] Data Programming using Semi-Supervision and Subset Selection.
本文提出了一种联合学习框架,将数据编程与半监督学习相结合,通过利用标注函数提供的弱监督信号和未标注数据来提升模型性能。该框架进一步引入了一种子集选择策略,以识别高质量的标注样本,实验证明其在合成数据集和真实世界数据集上均达到最先进性能。
The paradigm of data programming~\cite{bach2019snorkel} has shown a lot of promise in using weak supervision in the form of rules and labelling functions to learn in scenarios where labelled data is not available. Another approach which has shown a lot of promise is that of semi-supervised learning where we augment small amounts of labelled data with a large unlabelled dataset. In this work, we argue that by not using any labelled data, data programming based approaches can yield sub-optimal performance, particularly, in cases when the labelling functions are noisy. The first contribution of this work is to study a framework of joint learning which combines un-supervised consensus from labelling functions with semi-supervised learning and \emph{jointly learns a model} to efficiently use the rules/labelling functions along with semi-supervised loss functions on the feature space. Next, we also study a subset selection approach to \emph{select} the set of examples which can be used as the labelled set. We evaluate our techniques on synthetic data as well as four publicly available datasets and show improvement over state-of-the-art techniques\footnote{Source code of the paper at \url{this https URL}}.
研究动机与目标
- 解决在未使用任何标注数据时数据编程性能欠佳的问题,尤其是在标注函数存在噪声的情况下。
- 将标注函数的无监督一致性与半监督学习相结合,以提升模型的泛化能力。
- 开发一种子集选择方法,以识别并使用最可靠的样本作为标注训练集,从而提升训练效果。
- 在合成数据集和真实世界数据集上评估所提出的框架,验证其相对于最先进方法的性能提升。
提出的方法
- 构建一个联合学习目标,将标注函数的一致性与特征空间上的半监督损失函数相结合。
- 利用未标注数据训练模型,使其同时利用弱监督信号和特征空间中的结构信息。
- 应用子集选择机制,识别可用于训练的高置信度样本子集。
- 通过端到端可微训练优化联合目标,同时优化标注函数权重和模型参数。
- 利用模型不确定性以及标注函数之间的一致性来指导子集选择。
- 在选定的子集上训练最终模型,同时从完整的未标注数据集中引入半监督正则化。
实验结果
研究问题
- RQ1在未使用任何标注数据的情况下,将数据编程与半监督学习相结合是否能提升模型性能?
- RQ2与单独优化相比,联合优化标注函数权重和模型参数对性能有何影响?
- RQ3子集选择对标注数据集的质量以及下游模型准确率有何影响?
- RQ4所提出的方法在多样化的基准数据集上与最先进技术相比表现如何?
- RQ5在何种场景下,联合框架优于标准数据编程或单独的半监督学习方法?
主要发现
- 通过半监督学习引入未标注数据,联合学习框架显著提升了标准数据编程的模型性能。
- 子集选择方法能有效识别高质量样本,从而提升泛化能力并减少标注数据集中的噪声。
- 在四个公开数据集和合成数据上的实证评估表明,该方法持续优于最先进方法。
- 通过利用未标注数据和一致性模式,该框架对噪声标注函数表现出强鲁棒性。
- 联合优化标注函数权重和模型参数可获得比顺序或独立训练更可靠的预测结果。
- 弱监督与半监督学习的结合优于单独使用任一方法,性能更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。