Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Label Embedding for Text Classification

Honglun Zhang, Liqiang Xiao|arXiv (Cornell University)|Oct 17, 2017
Topic Modeling参考文献 14被引用 7
一句话总结

本文提出多任务标签嵌入(MTLE),将文本分类标签映射为密集语义向量,将分类任务转化为向量匹配问题。通过利用语义标签表示,MTLE 实现了可扩展的、可迁移的多任务学习,在仅进行最小架构修改的情况下,实现了多任务性能的提升,当四个任务联合训练时,平均准确率提升达 5.9%。

ABSTRACT

Multi-task learning in text classification leverages implicit correlations among related tasks to extract common features and yield performance gains. However, most previous works treat labels of each task as independent and meaningless one-hot vectors, which cause a loss of potential information and makes it difficult for these models to jointly learn three or more tasks. In this paper, we propose Multi-Task Label Embedding to convert labels in text classification into semantic vectors, thereby turning the original tasks into vector matching tasks. We implement unsupervised, supervised and semi-supervised models of Multi-Task Label Embedding, all utilizing semantic correlations among tasks and making it particularly convenient to scale and transfer as more tasks are involved. Extensive experiments on five benchmark datasets for text classification show that our models can effectively improve performances of related tasks with semantic representations of labels and additional information from each other.

研究动机与目标

  • 为解决单热编码标签表示在多任务文本分类中忽略类别间语义关系的局限性。
  • 实现可扩展的多任务学习,使新任务可轻松集成而无需重新训练或修改架构。
  • 支持迁移学习,使模型在相关任务上预训练后能泛化到新任务。
  • 通过联合学习标签语义与跨任务相关性,提升性能。
  • 开发 MTLE 的无监督、有监督和半监督变体,以适应多样化的学习场景。

提出的方法

  • 使用可学习的标签嵌入层,将每个文本分类任务的标签映射为低维实值语义向量。
  • 模型将文本分类视为向量匹配任务,其中文本表示与对应标签嵌入向量进行匹配。
  • 共享编码器网络处理输入序列,并为所有任务生成上下文相关的表示。
  • 损失函数结合了每个任务的交叉熵损失与对比损失,以对齐文本表示与对应标签嵌入。
  • 该架构支持无需结构修改即可联合训练三个或更多任务,实现了可扩展性。
  • 通过使用预训练的文本编码器和冻结的标签嵌入,对新任务微调标签嵌入空间,实现迁移学习。

实验结果

研究问题

  • RQ1与单热编码相比,将标签映射为语义向量是否能提升多任务文本分类的性能?
  • RQ2所提出的方法是否能在不重新训练或重新设计架构的情况下扩展到三个或更多任务?
  • RQ3在相关任务上预训练后,模型是否能泛化到新的、未见过的任务?
  • RQ4语义标签表示与跨任务相关性如何共同促进性能提升?
  • RQ5MTLE 在有监督和半监督设置下是否均优于最先进水平的多任务学习模型?

主要发现

  • 当四个任务联合训练时,MTLE 在所有任务上实现了平均 5.9% 的性能提升,证明了标签语义与跨任务相关性的重要价值。
  • 该模型在五个基准数据集上优于最先进基线模型,在大多数任务中表现具有竞争力或更优。
  • 在 IMDB 数据集上,PV 略优于 MTLE(91.7 vs. 91.3),但 MTLE 在序列较短的其他任务中表现出更强的泛化能力。
  • 模型展示了有效的迁移学习能力:在多个任务上预训练后,无需额外训练即可在新任务上达到可观的性能。
  • 对性能提升的可视化分析显示,Books 与 DVDs,以及 Electronics 与 Kitchen 之间具有更高的相关性,与语义直觉一致。
  • MTLE 的无监督和半监督变体表现出色,证实了该方法在不同数据可用性设置下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。