Skip to main content
QUICK REVIEW

[论文解读] FineText: Text Classification via Attention-based Language Model Fine-tuning

Yunzhe Tao, Saurabh Gupta|arXiv (Cornell University)|Oct 25, 2019
Topic Modeling参考文献 31被引用 4
一句话总结

FineText 提出了一种基于注意力机制的微调方法,通过从预训练语言模型中提取上下文相关的特征,以提升文本分类性能。通过应用自注意力机制选择相关表征,该模型在六个基准数据集上均取得了最先进(SOTA)的结果,相较于先前的 SOTA 方法,相对提升幅度在 2.27% 到 25.38% 之间。

ABSTRACT

Training deep neural networks from scratch on natural language processing (NLP) tasks requires significant amount of manually labeled text corpus and substantial time to converge, which usually cannot be satisfied by the customers. In this paper, we aim to develop an effective transfer learning algorithm by fine-tuning a pre-trained language model. The goal is to provide expressive and convenient-to-use feature extractors for downstream NLP tasks, and achieve improvement in terms of accuracy, data efficiency, and generalization to new domains. Therefore, we propose an attention-based fine-tuning algorithm that automatically selects relevant contextualized features from the pre-trained language model and uses those features on downstream text classification tasks. We test our methods on six widely-used benchmarking datasets, and achieve new state-of-the-art performance on all of them. Moreover, we then introduce an alternative multi-task learning approach, which is an end-to-end algorithm given the pre-trained model. By doing multi-task learning, one can largely reduce the total training time by trading off some classification accuracy.

研究动机与目标

  • 开发一种有效的迁移学习算法,利用预训练语言模型进行下游文本分类任务。
  • 解决从零开始训练深度神经网络的局限性,后者需要大量标注数据集和较长的训练时间。
  • 通过注意力机制进行特征选择,提升模型在准确率、数据效率和新领域泛化能力方面的表现。
  • 探索一种多任务学习方法,通过联合微调语言模型和分类器,缩短训练时间。
  • 评估预训练数据和模型架构对下游任务性能的影响。

提出的方法

  • 该方法采用自注意力机制,从预训练语言模型的隐藏状态中动态选择并加权相关上下文特征。
  • 所选的注意力加权特征被用作下游文本分类器的输入表征,替代传统的拼接或池化策略。
  • 模型通过交叉熵损失进行分类训练,并通过语言建模范式对特征进行优化,实现端到端训练。
  • 引入一种替代的多任务学习框架,其中语言模型与分类器通过结合两项目标的加权损失联合微调。
  • 注意力机制应用于序列级别,使模型能够聚焦于与分类相关的关键标记和上下文依赖关系。
  • 该方法采用标准预训练语言模型进行评估,微调在六个广泛使用的文本分类基准数据集上完成。

实验结果

研究问题

  • RQ1从预训练语言模型中基于注意力机制的特征选择,对下游文本分类任务性能有何影响?
  • RQ2预训练语言模型中的哪些因素(如训练数据、架构)对下游性能影响最大?
  • RQ3能否通过联合微调语言模型和分类器的多任务学习方法,在不损失分类准确率的前提下减少训练时间?
  • RQ4与 ULMFiT 和 ELMo 等现有 SOTA 方法相比,该方法在准确率和数据效率方面表现如何?
  • RQ5相较于固定池化或拼接策略,注意力机制在多大程度上提升了特征的代表性?

主要发现

  • 所提出的基于注意力机制的微调方法在所有六个测试基准数据集(包括 AG、IMDb、DBpedia、Yelp-bi、Yelp-full 和 Sogou 新闻)上均取得了新的最先进性能。
  • 在 Yelp-bi 数据集上,该方法相较于 ULMFiT 实现了 16.88% 的相对提升,相较于先前 SOTA 提升了 25.38%,在低资源设置下表现强劲。
  • 在 Sogou 新闻数据集上,相较于 ULMFiT 实现了 25.22% 的相对提升,相较于先前 SOTA 提升了 8.15%,凸显其在多样化领域中的有效性。
  • 多任务学习变体将 AG 新闻数据集的总训练时间从 6.5 小时减少至 3.5 小时,尽管性能略有下降至 5.49% 的错误率。
  • 注意力可视化结果表明,模型能够学习聚焦于语义相关的标记(如类别特定关键词),从而提升可解释性与特征相关性。
  • 单层自注意力机制在性能与复杂度的权衡上优于集成方法和多头注意力变体,因此被采纳为最终架构的核心组件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。