[论文解读] Does Head Label Help for Long-Tailed Multi-Label Text Classification
该论文提出了一种头到尾网络(HTTN),在长尾多标签文本分类中,将数据丰富的头部标签的元知识迁移至数据稀缺的尾部标签。通过学习从少样本到多实例标签分类器的参数迁移映射,HTTN在不重新训练模型的情况下提升了尾部标签的性能,在三个基准数据集上实现了最先进(SOTA)的结果,尤其在仅包含2–6个训练样本的极端长尾标签上表现优异。
Multi-label text classification (MLTC) aims to annotate documents with the most relevant labels from a number of candidate labels. In real applications, the distribution of label frequency often exhibits a long tail, i.e., a few labels are associated with a large number of documents (a.k.a. head labels), while a large fraction of labels are associated with a small number of documents (a.k.a. tail labels). To address the challenge of insufficient training data on tail label classification, we propose a Head-to-Tail Network (HTTN) to transfer the meta-knowledge from the data-rich head labels to data-poor tail labels. The meta-knowledge is the mapping from few-shot network parameters to many-shot network parameters, which aims to promote the generalizability of tail classifiers. Extensive experimental results on three benchmark datasets demonstrate that HTTN consistently outperforms the state-of-the-art methods. The code and hyper-parameter settings are released for reproducibility
研究动机与目标
- 为解决长尾多标签文本分类中因尾部标签训练数据不足而导致的泛化能力差的问题。
- 探究尽管存在数据不平衡,头部标签是否能有效帮助学习鲁棒的尾部标签分类器。
- 开发一种方法,利用标签依赖关系并从头部标签向尾部标签迁移元知识,而无需对整个模型进行重新训练以适应新标签。
- 在保持强头部标签性能的同时提升尾部标签性能,避免被高频率标签主导。
提出的方法
- HTTN将元知识学习为从少样本头部标签分类器权重到多实例头部标签分类器权重的映射。
- 该元知识记为 $W_{\text{transfer}}$,通过从头部标签的多个采样原型中提炼,以实现跨标签类别的泛化。
- 模型通过使用 $W_{\text{transfer}}$ 初始化尾部标签分类器,并在有限数据上进行微调,将该知识迁移至尾部标签。
- 采用注意力模块建模头部与尾部标签之间的标签相关性,以增强特征表示和预测准确性。
- 应用集成机制,将多个具有不同采样头部原型的HTTN实例组合,以提升鲁棒性与多样性。
- 该方法仅需在头部标签上进行训练;新尾部标签可立即使用预学习的元知识进行分类。
实验结果
研究问题
- RQ1头部标签能否提供有用的元知识,从而提升长尾多标签文本分类中低资源尾部标签的分类性能?
- RQ2头部与尾部标签之间的标签依赖关系如何影响多标签学习中的知识迁移?
- RQ3从少样本学习到多实例学习的通用、类别无关的映射是否能提升尾部标签的泛化能力?
- RQ4当引入新尾部标签时,所提出的方法是否能在不重新训练整个模型的情况下实现最先进性能?
- RQ5采样头部原型的数量如何影响迁移知识的鲁棒性与泛化能力?
主要发现
- HTTN在三个基准数据集(AAPD、RCV1及其他)上持续优于七种最先进基线方法,尤其在尾部标签上表现更优。
- 对于仅含2–6个训练样本的极端尾部标签,HTTN实现了非零的正样本预测,而Joint和BBN模型对所有此类标签均预测为零。
- HTTN的集成版本(EHTTN)性能最佳,表明通过多个模型实例可增强多样性与鲁棒性。
- 当采样原型数量($S$)从5增加到20时,F1分数显著提升,表明更丰富的元知识可带来更好的泛化能力。
- 注意力模块与微调组件均至关重要:移除任一组件均导致性能下降,表明其在捕捉标签相关性与提升准确性方面具有关键作用。
- 当 $l_{\text{tail}}$ 较小时(即尾部标签更少),HTTN性能更优,因为此时有更多头部标签可用于提炼更丰富的元知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。