Skip to main content
QUICK REVIEW

[论文解读] Multi-task Learning for Universal Sentence Embeddings: A Thorough Evaluation using Transfer and Auxiliary Tasks

Wasi Uddin Ahmad, Xueying Bai|arXiv (Cornell University)|Apr 21, 2018
Topic Modeling参考文献 42被引用 7
一句话总结

本文提出了一种多任务学习框架,通过在三个不同的文本分类任务——SNLI、Multi-NLI 和 Quora 重复问题检测——上联合优化,训练通用句子嵌入,从而在 15 个下游任务中显著提升了迁移性能。当与 ELMo 和 CoVe 等上下文相关的词表示结合时,该方法在单任务学习和当前最先进基线方法中表现更优。

ABSTRACT

Learning distributed sentence representations is one of the key challenges in natural language processing. Previous work demonstrated that a recurrent neural network (RNNs) based sentence encoder trained on a large collection of annotated natural language inference data, is efficient in the transfer learning to facilitate other related tasks. In this paper, we show that joint learning of multiple tasks results in better generalizable sentence representations by conducting extensive experiments and analysis comparing the multi-task and single-task learned sentence encoders. The quantitative analysis using auxiliary tasks show that multi-task learning helps to embed better semantic information in the sentence representations compared to single-task learning. In addition, we compare multi-task sentence encoders with contextualized word representations and show that combining both of them can further boost the performance of transfer learning.

研究动机与目标

  • 探究多任务学习是否相比单任务学习能提升通用句子嵌入的泛化能力。
  • 评估将多任务句子嵌入与上下文相关的词表示(如 ELMo、CoVe)结合,是否能进一步提升迁移学习性能。
  • 通过辅助任务分析多任务学习得到的句子表征所捕捉的语言信息(句法和语义)。
  • 确定多任务学习带来的性能提升是否源于训练数据量的增加,还是源于联合优化的归纳偏置。
  • 评估训练数据中多样化领域对所学句子表征质量的影响。

提出的方法

  • 在三个大规模文本分类数据集上训练共享的句子编码器:SNLI(自然语言蕴含)、Multi-NLI(多领域自然语言蕴含)和 Quora(重复问题检测)。
  • 实施两种多任务学习框架:完全共享(FS)和共享-私有(SP)模型,其中句子编码器在所有任务间共享,而任务特定的分类头则独立训练。
  • 使用 SP 模型中的共享编码器在 15 个下游迁移任务和六个辅助语言学任务上进行评估。
  • 将多任务句子嵌入与上下文相关的词表示(ELMo、CoVe)结合,形成混合编码方法。
  • 通过从 SNLI 和 Quora 数据中采样等大小的子集,开展消融实验,以隔离多任务学习对性能的影响,排除数据量的干扰。
  • 在迁移任务和辅助任务上评估性能,以衡量句法和语义表征的质量。

实验结果

研究问题

  • RQ1在多样化的 NLP 任务上进行多任务学习,是否相比单任务学习能带来更好的句子嵌入泛化能力?
  • RQ2迁移学习性能的提升在多大程度上源于训练数据量的增加,而非联合优化带来的归纳偏置?
  • RQ3与单任务学习和上下文相关的词表示相比,多任务学习得到的句子嵌入在捕捉句法和语义语言信息方面表现如何?
  • RQ4将多任务句子嵌入与上下文相关的词向量(如 ELMo、CoVe)结合,是否能在迁移任务上实现最先进性能?
  • RQ5在像 Multi-NLI 这类多领域数据集上进行训练,是否相比单领域数据集能带来更鲁棒的句子表征?

主要发现

  • 在 10 个迁移任务中的 7 个上,多任务学习优于单任务学习,其余 3 个任务表现相当,表明泛化能力得到提升。
  • 将多任务句子嵌入与 ELMo 和 CoVe 结合,在 10 个迁移任务中的 5 个上达到了新的最先进性能。
  • 在辅助任务上,多任务嵌入表现出竞争力,尤其在词义消歧任务中,表明其有效捕捉了语义信息。
  • 仅在 Multi-NLI 上训练的句子编码器在辅助任务上优于其他特定任务和共享编码器,表明领域多样性有助于提升表征质量。
  • 消融实验表明,与相同总数据量的单任务学习相比,多任务学习在迁移任务上平均提升 0.69%,证实其优势不仅来自数据量。
  • 在源任务与目标任务高度相似的任务中(如 STS-16),多任务学习仍优于单任务学习,表明其在低数据迁移场景下也具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。