Skip to main content
QUICK REVIEW

[论文解读] Deepening Hidden Representations from Pre-trained Language Models

Junjie Yang, Hai Zhao|arXiv (Cornell University)|Nov 5, 2019
Topic Modeling参考文献 36被引用 4
一句话总结

本文提出HIdden Representation Extractor(HIRE),一种动态机制,通过融合中间Transformer层的互补表征与最终层输出,增强预训练语言模型。以RoBERTa为骨干网络,HIRE在GLUE任务上表现更优,在SST-2上达到最先进结果,并在9项任务中的5项上超越基线模型,其核心是基于任务和输入特定需求自适应加权隐藏状态。

ABSTRACT

Transformer-based pre-trained language models have proven to be effective for learning contextualized language representation. However, current approaches only take advantage of the output of the encoder's final layer when fine-tuning the downstream tasks. We argue that only taking single layer's output restricts the power of pre-trained representation. Thus we deepen the representation learned by the model by fusing the hidden representation in terms of an explicit HIdden Representation Extractor (HIRE), which automatically absorbs the complementary representation with respect to the output from the final layer. Utilizing RoBERTa as the backbone encoder, our proposed improvement over the pre-trained models is shown effective on multiple natural language understanding tasks and help our model rival with the state-of-the-art models on the GLUE benchmark.

研究动机与目标

  • 解决微调后的预训练语言模型仅依赖最终层输出的局限性。
  • 探究中间层是否包含最终层未捕捉到的互补信息。
  • 设计一种动态自适应机制,融合多层表征以提升上下文感知语言表征能力。
  • 验证所提方法是否能在不修改骨干模型架构或预训练过程的前提下,提升多样化自然语言理解任务的性能。
  • 分析表征重要性在不同层、任务及单个样本间的差异。

提出的方法

  • HIRE是一个可学习的网络,从除最后一层外的所有隐藏层中提取互补表征。
  • 该方法采用动态重要性评分机制,根据输入和任务上下文,为每一隐藏层分配自适应权重。
  • 融合网络使用门控循环单元(GRU)架构,将最终层输出与HIRE提取的表征进行融合。
  • 重要性分数通过可微分的软注意力机制计算,聚合所有中间层的贡献。
  • 模型以与原始RoBERTa相同的优化目标进行端到端训练,保留骨干模型的预训练方式与架构。
  • 融合过程将优化后的表征集成到下游任务头中,不改变原始模型结构。

实验结果

研究问题

  • RQ1预训练Transformer模型的中间层是否能提供最终层未捕捉到的互补信息?
  • RQ2各隐藏层的贡献在不同自然语言理解任务及单个输入样本间如何变化?
  • RQ3与固定或单层融合相比,一种用于组合多层表征的动态自适应机制是否能提升下游性能?
  • RQ4所提出的HIRE组件是否能在不微调骨干模型的前提下,提升多样化GLUE基准任务的性能?
  • RQ5融合网络中GRU层的最优数量是多少,以在性能与复杂度之间取得平衡?

主要发现

  • HIRE在GLUE基准的9项任务中有5项表现提升,其中在SST-2情感分类任务上增益最为显著。
  • 该模型在SST-2数据集上达到最先进结果,优于基线RoBERTa模型。
  • 动态重要性评分机制优于固定策略(如平均或随机加权),证明了自适应机制的价值。
  • 消融实验表明,融合网络中使用两层GRU在CoLA任务上表现最佳,Matthews相关系数达69.7。
  • 不同任务的层重要性分布差异显著:单句和相似度任务中,中间层和低层贡献最大;而STS-B和RTE任务中,所有层贡献几乎相等。
  • 可视化结果证实,HIRE不仅在任务间自适应,也在单个样本间实现动态调整,且存在一致模式,如在SST-2中第21和22层最具影响力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。