[论文解读] Understanding Programmatic Weak Supervision via Source-aware Influence Function
本文提出源感知影响函数(SIF),一种新颖方法,通过分解程序化弱监督(PWS)中的训练损失,估算单个组件(如源投票、标注函数(LFs)和训练数据)对最终模型行为的影响。通过利用标签生成过程并采用重加权和权重移动扰动,SIF 实现了细粒度调试、误标注检测(比基线方法提升 9–37%)以及泛化性能提升(比普通影响函数提升 13–24%)。
Programmatic Weak Supervision (PWS) aggregates the source votes of multiple weak supervision sources into probabilistic training labels, which are in turn used to train an end model. With its increasing popularity, it is critical to have some tool for users to understand the influence of each component (e.g., the source vote or training data) in the pipeline and interpret the end model behavior. To achieve this, we build on Influence Function (IF) and propose source-aware IF, which leverages the generation process of the probabilistic labels to decompose the end model's training objective and then calculate the influence associated with each (data, source, class) tuple. These primitive influence score can then be used to estimate the influence of individual component of PWS, such as source vote, supervision source, and training data. On datasets of diverse domains, we demonstrate multiple use cases: (1) interpreting incorrect predictions from multiple angles that reveals insights for debugging the PWS pipeline, (2) identifying mislabeling of sources with a gain of 9%-37% over baselines, and (3) improving the end model's generalization performance by removing harmful components in the training objective (13%-24% better than ordinary IF).
研究动机与目标
- 为解决程序化弱监督(PWS)流水线中缺乏可解释性工具的问题,用户需要理解标注函数(LFs)、源投票和训练数据等单个组件的影响。
- 克服标准影响函数(IF)的局限性,后者将弱标签数据视为原子单元,忽略了 PWS 中底层的源级生成过程。
- 开发一种通用且与标签模型无关的框架,实现在 PWS 中的组件级影响估计,同时保持传统 IF 的可解释性和排序保真度。
- 支持实际应用,如调试模型错误、检测误标注的标注函数,以及通过有针对性的训练损失扰动提升模型泛化性能。
提出的方法
- 将 PWS 中的训练损失分解为与每个 (数据, 源, 类别) 三元组 $(i,j,c)$ 相关的项,称为 $(i,j,c)$-效应,以建模每个标注函数 $j$ 对数据点 $i$ 在类别 $c$ 上的贡献。
- 提出两种基于扰动的方法——重加权和权重移动——通过修改训练目标中特定 $(i,j,c)$-效应的贡献,计算源感知影响分数。
- 利用所得影响分数,估计更高级别组件的影响:通过在类别上聚合得到单个源投票的影响,通过在数据和类别上聚合得到标注函数的影响,通过在所有源和类别上聚合得到训练数据的影响。
- 利用影响分数的可加性,实现在 PWS 流水线不同组件间高效且可解释的影响估计。
- 应用标签模型近似(例如,用恒等函数替代非线性函数),以实现影响分数的可微分和可扩展计算,同时保持性能。
- 在 13 个涵盖表格、文本和图像领域的数据集上验证该方法,使用斯皮尔曼等级相关系数确认源感知 IF 保持了标准 IF 的排序性能。
实验结果
研究问题
- RQ1如何在程序化弱监督流水线中估计单个标注函数投票对最终模型预测的影响?
- RQ2在诊断模型误预测时,源感知影响函数是否比标准数据级影响函数提供更好的可解释性?
- RQ3源感知 IF 相较于现有基线,在多大程度上能检测出误标注的标注函数?
- RQ4基于源感知 IF 指导的细粒度训练损失扰动能否提升最终模型的泛化性能?
- RQ5所提方法在实现组件级影响估计的同时,是否保持了标准影响函数的排序保真度?
主要发现
- 源感知 IF 与标准数据级影响函数的斯皮尔曼等级相关系数为 0.71–0.99,证实其在影响排序方面的可靠性。
- 源感知 IF 通过识别最具影响力的标注函数或源投票,实现了对模型错误的更精确调试,而标准 IF 可能会错误地将影响归因于数据点。
- 该方法在多个数据集上检测误标注标注函数的 F1 分数比基线方法高出 9%–37%。
- 通过基于源感知 IF 扰动训练目标,该方法相比普通影响函数和组影响函数,将测试损失降低了 13%–24%。
- 使用恒等函数对非线性项进行标签模型近似,实现了高效且可扩展的影响计算,平均测试损失下降幅度极小。
- 该方法具有通用性且与标签模型选择无关,适用于采用不同标签建模技术的多种 PWS 流水线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。