[论文解读] Enhancing Label Correlation Feedback in Multi-Label Text Classification via Multi-Task Learning
该论文提出LACO,一种用于多标签文本分类的多任务学习框架,通过联合文档-标签嵌入以及两项辅助任务——成对标签共现预测(PLCP)和条件标签共现预测(CLCP),增强标签相关性反馈。该方法在AAPD和RCV1-V2数据集上优于强基线模型,表现出更好的泛化能力,尤其在低频标签和未见标签组合上,且收敛更快,标签多样性更优。
In multi-label text classification (MLTC), each given document is associated with a set of correlated labels. To capture label correlations, previous classifier-chain and sequence-to-sequence models transform MLTC to a sequence prediction task. However, they tend to suffer from label order dependency, label combination over-fitting and error propagation problems. To address these problems, we introduce a novel approach with multi-task learning to enhance label correlation feedback. We first utilize a joint embedding (JE) mechanism to obtain the text and label representation simultaneously. In MLTC task, a document-label cross attention (CA) mechanism is adopted to generate a more discriminative document representation. Furthermore, we propose two auxiliary label co-occurrence prediction tasks to enhance label correlation learning: 1) Pairwise Label Co-occurrence Prediction (PLCP), and 2) Conditional Label Co-occurrence Prediction (CLCP). Experimental results on AAPD and RCV1-V2 datasets show that our method outperforms competitive baselines by a large margin. We analyze low-frequency label performance, label dependency, label combination diversity and coverage speed to show the effectiveness of our proposed method on label correlation learning.
研究动机与目标
- 为解决序列到序列模型在多标签文本分类中的局限性,如标签顺序依赖性、对高频标签组合的过拟合以及误差传播问题。
- 通过显式建模标签相关性(而不依赖序列生成)来提升对低频标签的泛化能力。
- 通过捕捉二阶和高阶标签共现模式的辅助任务,增强标签相关性反馈。
- 开发一种模型,联合学习具有判别性的文档和标签表示,同时保持标签的顺序无关性。
提出的方法
- 使用基于Transformer的共享编码器与联合嵌入(JE)机制,将文档和标签表示联合学习于共享空间中。
- 采用文档-标签交叉注意力(CA)机制,生成保留判别性特征的特定标签文档表示。
- 引入成对标签共现预测(PLCP)任务,通过预测给定样本中两个标签是否共现,来建模二阶标签相关性。
- 提出条件标签共现预测(CLCP)任务,通过在给定部分相关标签的前提下预测未知标签的相关性,来建模高阶标签相关性。
- 端到端训练多任务学习框架,联合优化主多标签分类任务与两项辅助相关性学习任务。
- 使用基于BERT的编码器,并在主任务和辅助任务上使用交叉熵损失进行训练,实现特征共享与更优的表示学习。
实验结果
研究问题
- RQ1多任务学习框架是否能在不依赖序列生成的前提下,有效增强多标签文本分类中的标签相关性反馈?
- RQ2像PLCP和CLCP这样的辅助任务在多大程度上提升了泛化能力,特别是对低频和未见标签组合?
- RQ3与序列到序列模型相比,所提出方法在标签多样性、收敛速度和标签顺序鲁棒性方面表现如何?
- RQ4与独立标签建模相比,结合交叉注意力的联合文档-标签嵌入是否能生成更具判别性的表示?
主要发现
- LACO在AAPD和RCV1-V2两个数据集上均优于竞争性基线模型,取得了更高的Micro-F1分数和更好的子集准确率。
- 同时采用PLCP和CLCP辅助任务的模型在RCV1-V2上达到最高子集准确率(0.644),并生成了更多样化的标签组合(RCV1-V2上为241种唯一组合),优于基于Seq2Seq的模型。
- LACO在RCV1-V2上生成的标签组合更多样化(321种),远超Seq2Seq T模型(87种),表明其对未见标签组合的泛化能力更强。
- LACO在RCV1-V2测试集上的模型预测标签分布与真实标签分布之间的KL散度更低(0.76),低于Seq2Seq T模型(0.94),表明其对标签依赖模式的拟合更优。
- LACO收敛速度优于其他基于BERT的模型,如收敛速度曲线所示,多任务学习加速了训练过程。
- 该模型在低频标签上表现强劲,得益于辅助任务提供的增强标签相关性反馈,预测能力显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。