Skip to main content
QUICK REVIEW

[论文解读] Learning Robust, Transferable Sentence Representations for Text Classification

Wasi Uddin Ahmad, Xueying Bai|arXiv (Cornell University)|Sep 28, 2018
Topic Modeling参考文献 38被引用 3
一句话总结

本文提出了一种多任务学习框架,通过在多个文本分类数据集上联合训练句子编码器,将通用语言特征与特定任务知识分离,从而学习到鲁棒且可迁移的句子表征。通过结合预训练的上下文嵌入(ELMo)和另一种多任务句子编码器(GenSen),该方法在15项迁移学习任务和10项语言学探针任务上实现了最先进性能,展现出卓越的样本效率和泛化能力。

ABSTRACT

Despite deep recurrent neural networks (RNNs) demonstrate strong performance in text classification, training RNN models are often expensive and requires an extensive collection of annotated data which may not be available. To overcome the data limitation issue, existing approaches leverage either pre-trained word embedding or sentence representation to lift the burden of training RNNs from scratch. In this paper, we show that jointly learning sentence representations from multiple text classification tasks and combining them with pre-trained word-level and sentence level encoders result in robust sentence representations that are useful for transfer learning. Extensive experiments and analyses using a wide range of transfer and linguistic tasks endorse the effectiveness of our approach.

研究动机与目标

  • 通过在不从零开始训练的情况下学习可迁移的句子表征,解决文本分类中标注数据有限的挑战。
  • 通过从多个异构文本分类数据集中联合学习,提升句子表征的鲁棒性与可迁移性。
  • 在多任务学习框架中利用对抗训练,将通用语言特征(如句法、语义)与特定任务知识分离。
  • 通过融合句子级表征与预训练的上下文嵌入(ELMo)以及互补的多任务句子编码器(GenSen),提升性能。

提出的方法

  • 在三个大规模文本分类数据集上训练多任务句子编码器:SNLI(自然语言蕴含)、QQP(问题 paraphrase)以及第三个多样化文本分类数据集,以确保领域多样性。
  • 采用对抗训练策略,将共享(通用)表征与特定任务表征分离,从而提升泛化能力与可迁移性。
  • 使用共享编码器学习通用语言特征,使用私有编码器学习领域特定知识,并通过基于注意力的融合机制动态加权每项迁移任务的贡献。
  • 将基于多任务学习的句子编码器与 ELMo(上下文嵌入)以及 GenSen(多任务句子编码器)结合,构建统一的句子表征模型。
  • 在下游迁移任务中应用统一编码器,使用简单的分类头实现端到端微调,仅需少量标注数据。
  • 通过语言学探针任务分析所学习表征中捕捉了哪些语言属性(如句法、语义)

实验结果

研究问题

  • RQ1与单任务预训练相比,跨多个文本分类任务联合学习句子表征是否能提升其鲁棒性与可迁移性?
  • RQ2对抗训练在多任务学习框架中分离通用语言特征与特定任务知识方面是否有效?
  • RQ3组合的句子表征与上下文嵌入表征在迁移学习与探针任务中是否显著优于单一组件?
  • RQ4在标注数据稀缺的情况下,所提出方法的样本效率如何?
  • RQ5所提出的统一句子编码器最能捕捉哪些语言属性(如句法、语义)?”

主要发现

  • 基于多任务学习的句子编码器(Sent2Vec)在15项迁移学习任务中优于单任务模型(如 InferSent),与 ELMo 和 GenSen 联合使用时,在 SST-2 数据集上平均准确率达到 91.0,达到最先进水平。
  • 统一编码器(Sent2Vec + GenSen + ELMo)在全部10项语言学探针任务中表现最佳,其中在 CoordInv 任务上平均准确率为 73.3,在 SOMO 任务上为 71.1,优于 ELMo 和 InferSent。
  • 在 SST-2 和 SICK-E 任务中,所提方法展现出显著更高的样本效率,仅使用不到 5,000 个标注样本即达到优于从零开始训练的性能。
  • 对抗训练有效实现了通用与特定任务表征的分离,表现为在大多数迁移任务中共享编码器的注意力权重较低,表明分离效果更优。
  • SNLI 特定编码器在大多数迁移任务中获得更高的注意力权重,证实其在多样化文本分类任务中具有强大的泛化能力。
  • 将多任务句子编码器与 ELMo 和 GenSen 联合使用可获得最佳整体性能,表明不同预训练目标提供的互补学习信号显著增强了模型的鲁棒性与可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。