[论文解读] HPT: Hierarchy-aware Prompt Tuning for Hierarchical Text Classification
本文提出HPT,一种用于层次化文本分类的层次感知提示调优方法,通过将标签层次知识整合到软提示中,并使用零边界多标签交叉熵损失来与掩码语言建模目标对齐。HPT在三个基准数据集上达到最先进性能,在标签不平衡和低资源设置下显著提升性能。
Hierarchical text classification (HTC) is a challenging subtask of multi-label classification due to its complex label hierarchy. Recently, the pretrained language models (PLM)have been widely adopted in HTC through a fine-tuning paradigm. However, in this paradigm, there exists a huge gap between the classification tasks with sophisticated label hierarchy and the masked language model (MLM) pretraining tasks of PLMs and thus the potentials of PLMs can not be fully tapped. To bridge the gap, in this paper, we propose HPT, a Hierarchy-aware Prompt Tuning method to handle HTC from a multi-label MLM perspective. Specifically, we construct a dynamic virtual template and label words that take the form of soft prompts to fuse the label hierarchy knowledge and introduce a zero-bounded multi-label cross entropy loss to harmonize the objectives of HTC and MLM. Extensive experiments show HPT achieves state-of-the-art performances on 3 popular HTC datasets and is adept at handling the imbalance and low resource situations. Our code is available at https://github.com/wzh9969/HPT.
研究动机与目标
- 解决预训练语言模型(PLMs)在掩码语言建模预训练与层次化文本分类微调之间的差距。
- 通过在软提示中引入深度和宽度信息,将标签层次结构整合,弥合层次与平坦之间的差距。
- 通过将HTC重新表述为多标签掩码语言建模任务,解决多标签与多分类之间的差距。
- 提升在标签不平衡和低资源层次化文本分类场景下的性能。
提出的方法
- 构建动态虚拟模板和标签词作为编码标签层次深度与宽度信息的连续软提示。
- 通过将结构特征(深度、宽度)嵌入软提示标记,将标签层次知识整合到提示设计中。
- 采用零边界多标签交叉熵损失,同时提高正确标签的得分并降低错误标签的得分。
- 将层次化文本分类转化为层次感知的多标签掩码语言建模任务,以更好地与PLM预训练目标对齐。
- 使用预训练语言模型作为主干网络,采用提示调优而非全量微调,以保留预训练知识。
- 通过掩码标签预测头并优化软提示参数,将提示调优模型应用于下游HTC任务。
实验结果
研究问题
- RQ1通过整合标签层次结构,提示调优能否有效适配于层次化文本分类?
- RQ2层次感知的提示设计在标签不平衡层次中如何提升性能?
- RQ3零边界多标签交叉熵损失能否更好地对齐HTC与掩码语言建模的目标?
- RQ4在低资源和长尾标签场景下,HPT是否优于现有微调和基于提示的方法?
- RQ5HPT在多大程度上缓解了层次化文本分类中的预训练-微调差距?
主要发现
- HPT在三个流行的层次化文本分类数据集(NYT、RCV1-V2和DBPedia)上达到最先进性能。
- 在NYT数据集中,HPT显著提升了中等深度标签簇(深度3和4)的宏F1分数,这些类别在基线模型中通常表现不佳。
- HPT显著缩小了低资源标签的性能差距,在长尾场景下表现出强鲁棒性。
- 在仅使用10%训练数据的低资源设置下,HPT优于所有基线模型,并保持更低的标准差,表明其具有更好的稳定性。
- 在RCV1-V2数据集中,HPT在低资源设置下相比次优基线模型实现了6.09分的宏F1分数提升,而在全资源设置下仅提升2.13分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。