Skip to main content
QUICK REVIEW

[论文解读] Pretrained Generalized Autoregressive Model with Adaptive Probabilistic Label Clusters for Extreme Multi-label Text Classification

Hui Ye, Zhiyu Chen|arXiv (Cornell University)|Jul 5, 2020
Text and Document Classification Technologies参考文献 39被引用 16
一句话总结

该论文提出 APLC-XLNet,一种用于极端多标签文本分类的新型深度学习框架,通过微调 XLNet 预训练语言模型以增强文本表示,并引入自适应概率标签聚类(APLC)以高效处理不平衡的标签分布。该方法在五个基准数据集中的四个上达到最先进性能,且在 EURLex-4k 数据集上相较先前方法在 P@3 和 P@5 指标上取得最高达 10% 的显著提升。

ABSTRACT

Extreme multi-label text classification (XMTC) is a task for tagging a given text with the most relevant labels from an extremely large label set. We propose a novel deep learning method called APLC-XLNet. Our approach fine-tunes the recently released generalized autoregressive pretrained model (XLNet) to learn a dense representation for the input text. We propose Adaptive Probabilistic Label Clusters (APLC) to approximate the cross entropy loss by exploiting the unbalanced label distribution to form clusters that explicitly reduce the computational time. Our experiments, carried out on five benchmark datasets, show that our approach has achieved new state-of-the-art results on four benchmark datasets. Our source code is available publicly at https://github.com/huiyegit/APLC_XLNet.

研究动机与目标

  • 解决在大规模标签集合下进行极端多标签文本分类(XMTC)时学习有效上下文文本表示的挑战。
  • 通过利用标签分布的稀疏性,克服使用极大规模标签集合进行训练时的计算低效问题。
  • 开发一种灵活且可扩展的输出层机制,以减少训练和推理时间,同时不牺牲预测准确性。
  • 证明将预训练语言模型与结构化标签聚类相结合在 XMTC 任务中的有效性。

提出的方法

  • 微调广义自回归预训练模型 XLNet,以学习输入文本序列的深层上下文表示。
  • 提出自适应概率标签聚类(APLC),一种基于标签频率和共现模式的分层聚类策略。
  • 将 APLC 应用于通过将输出层拆分为头部聚类(高频标签)和尾部聚类(低频标签)来近似交叉熵损失,从而降低计算量。
  • 采用两阶段预测:首先预测头部聚类,然后在选定聚类内使用条件概率模型进一步优化预测结果。
  • 采用可微聚类机制,使聚类分配过程可通过反向传播进行端到端训练。
  • 通过可调节参数配置 APLC,以在准确率与计算成本之间取得平衡,包括聚类数量和标签分布比例。

实验结果

研究问题

  • RQ1与先前模型相比,微调 XLNet 以获取文本表示是否能显著提升极端多标签文本分类的性能?
  • RQ2APLC 机制在保持或提升预测准确率的同时,是否能有效降低计算成本,尤其在处理不平衡标签分布时?
  • RQ3聚类数量以及标签在各聚类中的分布对不同 XMTC 数据集上模型性能的影响如何?
  • RQ4APLC 是否可泛化为其他极端分类任务(超越文本分类)的高效输出层?

主要发现

  • APLC-XLNet 在五个基准数据集中的四个上达到新的最先进结果,尤其在 EURLex-4k 数据集上相较先前最先进方法 AnnexML 在 P@3 和 P@5 指标上提升高达 10%。
  • 在三个数据集(EURLex-4k、AmazonCat-13k、Wiki10-31k)上,APLC-XLNet 超过强基线模型 DisMEC 和 AttentionXML,且在 top-k 精确率上保持一致提升。
  • 在 EURLex-4k 数据集上,APLC-XLNet 在仅使用 2 个聚类时即达到 P@1 为 87.72,当聚类数增加至 6 个时性能下降 2%,表明过多聚类会损害性能。
  • 消融实验表明,将更多标签分配给头部聚类(如 70%)能显著提升 P@1,尤其在 EURLex 等标签分布高度偏斜的数据集中效果更明显。
  • 即使聚类数量增加,该方法仍保持高性能,表明其在超参数调优中具备强鲁棒性与灵活性。
  • 通过结构化标签聚类,APLC-XLNet 在降低计算成本的同时保持高准确率,使其适用于大规模标签集合的实际应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。