[论文解读] Data Programming using Continuous and Quality-Guided Labeling Functions
本文提出了 CAGE,一种数据编程框架,将标注函数(LFs)扩展为输出连续得分而非离散标签,从而实现更细致且语义灵活的弱监督。通过整合用户提供的质量指导和一种新型训练目标,CAGE 在基线方法上提升了模型的稳定性和性能,在五个任务中实现了更高的召回率和一致的准确率,且无需依赖验证数据进行超参数调优。
Scarcity of labeled data is a bottleneck for supervised learning models. A paradigm that has evolved for dealing with this problem is data programming. An existing data programming paradigm allows human supervision to be provided as a set of discrete labeling functions (LF) that output possibly noisy labels to input instances and a generative modelfor consolidating the weak labels. We enhance and generalize this paradigm by supporting functions that output a continuous score (instead of a hard label) that noisily correlates with labels. We show across five applications that continuous LFs are more natural to program and lead to improved recall. We also show that accuracy of existing generative models is unstable with respect to initialization, training epochs, and learning rates. We give control to the data programmer to guide the training process by providing intuitive quality guides with each LF. We propose an elegant method of incorporating these guides into the generative model. Our overall method, called CAGE, makes the data programming paradigm more reliable than other tricks based on initialization, sign-penalties, or soft-accuracy constraints.
研究动机与目标
- 解决数据编程中离散标注函数的局限性,后者常因严格的词典匹配而遗漏语义相似的术语。
- 提升标签聚合生成模型的可靠性与稳定性,此类模型对初始化、学习率和训练轮数敏感。
- 为数据程序员提供可解释的、基于质量引导的训练过程控制,减少对不可解释超参数的依赖。
- 通过支持输出与真实标签相关的真实值得分的连续 LFs,推广数据编程范式。
- 设计一种系统化的方法,将用户提供的质量指导整合到生成模型中,以提升收敛性和性能。
提出的方法
- 提出连续标注函数(LFs),基于预训练词嵌入的余弦相似度等相似性度量输出实值得分,而非硬标签。
- 引入一种生成模型,使用无向且全局归一化的势函数联合建模离散和连续 LFs,以更好地捕捉 LFs 之间的交互关系。
- 在训练目标中将用户提供的质量指导作为软约束,采用符号惩罚和边缘正则化以稳定优化过程。
- 采用标签与标注函数的联合似然模型,通过带正则化的最大似然估计学习参数。
- 使用数据无关的正则化器处理 LFs 的边缘分布,采用数据驱动的方法整合质量指导,两者均通过实证评估。
- 设计一种联合训练目标,整合连续与离散 LFs 信号,同时确保在不同初始化方案和超参数下的稳定性。
实验结果
研究问题
- RQ1在弱监督学习中,输出实值得分的连续标注函数是否能相比离散 LFs 提高召回率和覆盖度?
- RQ2用户提供的质量指导如何影响生成模型在标签聚合中的稳定性和准确性?
- RQ3所提出的 CAGE 框架是否在不同初始化方案、学习率和训练轮数下均优于现有方法,表现出更高的稳定性?
- RQ4质量指导能否有效整合到训练过程中,以替代启发式超参数(如符号惩罚或软准确率约束)?
- RQ5与有向贝叶斯网络方法相比,使用全局归一化势函数联合建模连续与离散 LFs 是否更具有效性?
主要发现
- 在五个多样化应用场景中,CAGE 使用连续 LFs 实现了比离散 LFs 更高的召回率,证明了词嵌入软匹配的优势。
- 采用数据无关正则化的 CAGE 模型(CAGE-C)提供了最可靠的性能提升,优于其他变体,包括使用符号惩罚或数据驱动指导的模型。
- 使用无向且全局归一化势函数的生成模型比有向贝叶斯网络更有效地捕捉 LFs 之间的交互关系,所有任务的性能均得到提升。
- 用户提供的质量指导显著提升了训练稳定性和模型性能,尤其在结合恰当正则化时,降低了对初始化和超参数的敏感性。
- 该方法在所有五个任务中均实现了 F1 和准确率的一致性提升,且无需使用标注的验证数据进行超参数调优。
- 消融研究证实,局部归一化对建模连续 LFs 得分至关重要,而全局归一化则增强了模型捕捉 LFs 依赖关系的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。