Skip to main content
QUICK REVIEW

[论文解读] Efficient strategies for hierarchical text classification: External knowledge and auxiliary tasks

Kervy Rivas Rojas, Gina Bustamante|arXiv (Cornell University)|May 5, 2020
Topic Modeling参考文献 23被引用 7
一句话总结

本文提出高效、低复杂度的策略,通过引入反向层次辅助任务并利用向量化的类别定义整合外部知识,以改进层次化文本分类。通过将这些方法与序列到序列模型结合,该方法在WOS和DBpedia数据集上实现了最先进的准确率,参数量显著减少,训练时间也更短,优于先前的方法。

ABSTRACT

In hierarchical text classification, we perform a sequence of inference steps to predict the category of a document from top to bottom of a given class taxonomy. Most of the studies have focused on developing novels neural network architectures to deal with the hierarchical structure, but we prefer to look for efficient ways to strengthen a baseline model. We first define the task as a sequence-to-sequence problem. Afterwards, we propose an auxiliary synthetic task of bottom-up-classification. Then, from external dictionaries, we retrieve textual definitions for the classes of all the hierarchy's layers, and map them into the word vector space. We use the class-definition embeddings as an additional input to condition the prediction of the next layer and in an adapted beam search. Whereas the modified search did not provide large gains, the combination of the auxiliary task and the additional input of class-definitions significantly enhance the classification accuracy. With our efficient approaches, we outperform previous studies, using a drastically reduced number of parameters, in two well-known English datasets.

研究动机与目标

  • 通过聚焦于非架构改进,解决当前最先进层次化文本分类(HTC)模型的高计算成本问题。
  • 在不增加模型复杂度或训练时间的前提下提升模型性能。
  • 探索将外部知识——特别是类别的文本定义——整合到预测过程中的方法。
  • 研究反向层次辅助任务是否能改善误差反向传播和表征学习。
  • 评估在低资源和高资源设置下,多种高效策略组合的影响。

提出的方法

  • 将任务建模为序列到序列学习问题,编码器处理输入文档,解码器从层次结构的顶层到底层逐级生成类别标签。
  • 引入一个辅助任务,将预测顺序反转,从最具体的类别预测到根节点,以平衡各层的误差反向传播并改善表征学习。
  • 从外部词典中检索所有类别的文本定义,并将其嵌入到词向量空间中,形成类别定义向量(CDVs)。
  • 通过父节点条件机制(PNC)利用CDVs来调节每一层的预测,从而在每个解码步骤中注入外部知识。
  • 改进的束搜索算法结合CDVs以引导候选生成,提升层次路径的选择质量。
  • 在两个基准数据集WOS和DBpedia上结合并评估这些方法,辅以消融研究以分离各方法的贡献。

实验结果

研究问题

  • RQ1反向层次辅助任务是否能通过平衡各层之间的误差反向传播来提升层次化文本分类的性能?
  • RQ2将类别的向量化文本定义作为外部知识整合,是否能提升层次化文本分类的准确率?
  • RQ3结合辅助任务和外部知识是否能以更少参数和更快训练时间实现最先进的性能,优于现有方法?
  • RQ4这些策略在高资源和低资源数据集上的表现有何差异?
  • RQ5是否能有效在解码阶段应用知识集成,以改善层次化预测?

主要发现

  • 辅助任务与父节点条件(PNC)结合类别定义嵌入,在WOS数据集上实现了最高准确率,优于先前的最先进模型。
  • 在DBpedia数据集上,由于训练样本显著更多,外部知识带来的增益较为有限,表明大规模数据集会降低外部知识的相对收益。
  • 所提方法在WOS和DBpedia上均实现了最先进的性能,且相比先前方法参数量大幅减少。
  • 每个模型的训练时间保持在约一小时(30个周期),辅助任务未引入显著计算开销。
  • 改进的束搜索未带来显著提升,但PNC策略在与束搜索结合时始终能增强性能。
  • 结果表明,外部知识集成与辅助任务是正交且互补的,当两者同时应用时,性能增益最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。