Skip to main content
QUICK REVIEW

[论文解读] CascadeXML: Rethinking Transformers for End-to-end Multi-resolution Training in Extreme Multi-label Classification

Siddhant Kharbanda, Atmadeep Banerjee|arXiv (Cornell University)|Oct 29, 2022
Text and Document Classification Technologies被引用 5
一句话总结

CascadeXML 提出了一种用于极端多标签分类(XMC)的端到端、多分辨率训练框架,利用 Transformer 的层次注意力机制,在标签树的每个分辨率层级上学习独特的特征表示。通过使用分辨率特定的注意力图和独立监督对单一 Transformer 编码器进行训练,该方法在包含最多三百万个标签的数据集上实现了最先进性能,优于 XR-Transformer 和 LightXML 等先前方法,且无需迭代重新聚类或共享注意力头。

ABSTRACT

Extreme Multi-label Text Classification (XMC) involves learning a classifier that can assign an input with a subset of most relevant labels from millions of label choices. Recent approaches, such as XR-Transformer and LightXML, leverage a transformer instance to achieve state-of-the-art performance. However, in this process, these approaches need to make various trade-offs between performance and computational requirements. A major shortcoming, as compared to the Bi-LSTM based AttentionXML, is that they fail to keep separate feature representations for each resolution in a label tree. We thus propose CascadeXML, an end-to-end multi-resolution learning pipeline, which can harness the multi-layered architecture of a transformer model for attending to different label resolutions with separate feature representations. CascadeXML significantly outperforms all existing approaches with non-trivial gains obtained on benchmark datasets consisting of up to three million labels. Code for CascadeXML will be made publicly available at \url{https://github.com/xmc-aalto/cascadexml}.

研究动机与目标

  • 为解决现有 XMC 方法在标签树各层级上难以保持独立、分辨率特定的特征表示的问题。
  • 实现单一 Transformer 模型在元标签筛选和极端分类任务上的端到端训练,避免迭代重新聚类或冻结特征提取。
  • 通过利用多层注意力机制实现不同分辨率的建模,提升在极端规模数据集(最多 300 万个标签)上的性能。
  • 通过按分辨率解耦特征表示,缓解端到端模型(如 LightXML)中元分类与极端分类任务之间的干扰。
  • 在保持最细粒度(极端)分辨率下高质量表示的同时,仍能有效实现粗粒度层级的筛选。

提出的方法

  • CascadeXML 使用单一 Transformer 编码器,并为层次标签树(HLT)的每个分辨率层级配备独立的分类头。
  • 采用端到端学习的分辨率特定注意力图,使粗粒度和细粒度标签预测具有不同的注意力模式。
  • 通过多任务目标联合训练所有分类头,其中极端分辨率头的梯度反向传播通过所有层,而粗粒度任务仅影响早期层。
  • 中间 Transformer 层的特征表示用于粗粒度层级的筛选,而最终层则专用于极端分类优化。
  • 该框架通过端到端训练所有组件,避免了中间重新聚类或特征冻结,与 XR-Transformer 的迭代式流水线不同。
  • 通过注意力机制动态学习标签候选列表,替代静态预计算的聚类,并在中间特征较不精细时仍保持高召回率。

实验结果

研究问题

  • RQ1单一 Transformer 模型能否在极端多标签分类的标签层次结构中,有效学习跨多个层级的独立、分辨率特定的注意力模式?
  • RQ2与共享注意力或单层级模型相比,使用每分辨率独立监督的端到端训练是否能提升性能?
  • RQ3Transformer 的中间层能否提供足够高质量的表示以支持元分类任务,同时仍保留最终层用于极端分类的表示?
  • RQ4与迭代法或冻结特征方法相比,所提出的多分辨率训练方案在准确率和训练效率方面表现如何?
  • RQ5按分辨率解耦特征表示在多大程度上缓解了筛选与极端分类任务之间的干扰?

主要发现

  • CascadeXML 在包含最多三百万个标签的基准 XMC 数据集上实现了最先进性能,显著优于先前方法如 XR-Transformer 和 LightXML。
  • 该模型表明,分辨率特定的注意力图在不同层级上产生了显著不同的注意力模式,验证了采用独立注意力头的设计选择。
  • 通过利用中间 Transformer 层进行粗粒度层级筛选,同时将最终层专用于极端分类,CascadeXML 在保持最细粒度分辨率下高质量表示的同时,未降低筛选召回率。
  • 端到端训练方案消除了对迭代重新聚类或特征冻结的需求,相比 XR-Transformer 的多阶段流水线,简化了训练流程并提升了推理速度。
  • 即使在中间特征较不精细的情况下,模型在标签筛选任务中仍保持高召回率,证实元任务对表示质量的敏感度低于极端分类任务。
  • 附录 B 的实证结果表明,不同分辨率下学习到的注意力图显著不同,支持了不同任务需要不同注意力模式的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。