[论文解读] Weakly Supervised Multi-task Learning for Concept-based Explainability
本文提出了一种弱监督多任务学习框架,利用专家规则生成的噪声概念标签和少量黄金标签,联合提升欺诈检测与基于概念的可解释性。通过结合两阶段和混合学习策略,该方法在仅造成可解释性轻微损失的情况下,将决策任务性能提升了417.8%,展示了在标签稀缺条件下有效实现联合学习的能力。
In ML-aided decision-making tasks, such as fraud detection or medical diagnosis, the human-in-the-loop, usually a domain-expert without technical ML knowledge, prefers high-level concept-based explanations instead of low-level explanations based on model features. To obtain faithful concept-based explanations, we leverage multi-task learning to train a neural network that jointly learns to predict a decision task based on the predictions of a precedent explainability task (i.e., multi-label concepts). There are two main challenges to overcome: concept label scarcity and the joint learning. To address both, we propose to: i) use expert rules to generate a large dataset of noisy concept labels, and ii) apply two distinct multi-task learning strategies combining noisy and golden labels. We compare these strategies with a fully supervised approach in a real-world fraud detection application with few golden labels available for the explainability task. With improvements of 9.26% and of 417.8% at the explainability and decision tasks, respectively, our results show it is possible to improve performance at both tasks by combining labels of heterogeneous quality.
研究动机与目标
- 解决现实机器学习应用中基于概念的可解释性所面临的概念标签稀缺问题。
- 实现使用异质质量标签(噪声标签与黄金标签)进行决策与可解释性任务的联合学习。
- 开发并评估能够有效结合弱监督与有限黄金标签的多任务学习策略。
- 在黄金标签稀缺但存在专家规则的低资源环境下提升模型性能。
- 实证验证基于规则生成的噪声标签是否能够同时提升可解释性与决策任务性能。
提出的方法
- 利用现成的专家规则,自动为真实电子商务欺诈检测数据集中的数百万实例生成噪声概念标签。
- 采用硬参数共享的神经网络架构,共享早期层,为决策与可解释性任务分别设置特定输出头。
- 提出两种多任务学习策略:两阶段学习(先在噪声标签上预训练,再在黄金标签或混合批次上微调)与混合学习(仅在混合黄金/噪声批次上训练)。
- 应用类别平衡采样与焦点损失,以处理多标签可解释性预测中的类别不平衡问题。
- 在两阶段训练中采用课程学习方法,从高置信度的噪声样本开始,以稳定学习过程。
- 调整学习率、损失权重与批次组成等超参数,以优化任务之间的权衡。
实验结果
研究问题
- RQ1由专家规则生成的噪声概念标签能否有效提升决策与可解释性任务的联合学习效果?
- RQ2在结合噪声标签与黄金标签时,两阶段学习与混合学习两种多任务学习策略在性能上如何比较?
- RQ3在不降低决策任务性能的前提下,弱监督在多大程度上可减少对稀缺黄金标签的依赖?
- RQ4在使用混合质量标签时,可解释性与决策性能之间的最优权衡是什么?
- RQ5与仅使用黄金标签的完全监督学习相比,使用异质标签信号的联合学习是否能带来更好的泛化能力?
主要发现
- 两阶段学习策略相比仅使用842个黄金标签实例的完全监督基线,将决策任务性能提升了417.8%。
- 两阶段策略在可解释性性能上也比基线提高了9.26%,证明了在两个任务上均实现了同步提升。
- 混合学习策略表现出一致的性能权衡,但在任一任务上均未超越两阶段方法。
- 在大规模噪声标签上进行弱监督训练的模型,其泛化能力显著优于仅在小规模黄金标签数据集上训练的模型。
- 表现最佳的模型采用两阶段策略,并在微调阶段使用纯黄金批次,其在可解释性与决策任务上均表现出高绩效,代表了最优的权衡。
- 结果证实,通过多任务学习结合噪声与黄金标签,在黄金标签有限的情况下仍具有效性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。