Skip to main content
QUICK REVIEW

[论文解读] ERNIE-Doc: A Retrospective Long-Document Modeling Transformer

Siyu Ding, Junyuan Shang|arXiv (Cornell University)|Dec 31, 2020
Topic Modeling参考文献 43被引用 11
一句话总结

ERNIE-Doc 提出了一种基于回顾性长文档建模的 Transformer 模型,通过引入回顾性前馈机制和增强的循环机制,克服了标准 Transformer 在长序列建模中因固定序列注意力导致的上下文碎片化问题,使模型在训练过程中能够实现全文档上下文感知。该模型在多个英文和中文自然语言理解任务上取得了最先进性能,包括在 WikiText-103 上达到 16.8 的困惑度。

ABSTRACT

Transformers are not suited for processing long documents, due to their quadratically increasing memory and time consumption. Simply truncating a long document or applying the sparse attention mechanism will incur the context fragmentation problem or lead to an inferior modeling capability against comparable model sizes. In this paper, we propose ERNIE-Doc, a document-level language pretraining model based on Recurrence Transformers. Two well-designed techniques, namely the retrospective feed mechanism and the enhanced recurrence mechanism, enable ERNIE-Doc, which has a much longer effective context length, to capture the contextual information of a complete document. We pretrain ERNIE-Doc to explicitly learn the relationships among segments with an additional document-aware segment-reordering objective. Various experiments were conducted on both English and Chinese document-level tasks. ERNIE-Doc improved the state-of-the-art language modeling result of perplexity to 16.8 on WikiText-103. Moreover, it outperformed competitive pretraining models by a large margin on most language understanding tasks, such as text classification and question answering.

研究动机与目标

  • 解决标准 Transformer 中因固定序列注意力导致的长文档建模中上下文碎片化问题。
  • 克服稀疏注意力和标准循环 Transformer 的局限性,后者限制了有效上下文长度,并在训练过程中无法充分利用全文档信息。
  • 通过允许每个段落在训练期间关注整个文档上下文,实现对完整文档的双向建模。
  • 通过一种新颖的文档感知段落重排目标,建模段落间关系,提升文档级表征学习能力。
  • 在英文和中文的长上下文语言建模及下游自然语言理解任务中均实现最先进性能。

提出的方法

  • 引入回顾性前馈机制,其中文档段落被处理两次:首次在扫描阶段构建初始表征,随后在回顾阶段,每个段落可关注全文档上下文。
  • 提出增强循环机制,用同层循环替代层间移位,使高层表征可在各层间复用,显著提升有效上下文长度。
  • 设计一种文档感知的段落重排目标,用于预训练模型以预测打乱后文档段落的正确顺序,从而学习段落间关系。
  • 使用增强循环机制进行自回归语言建模训练,使模型理论上可处理无限长度序列。
  • 在大规模英文和中文语料上进行预训练,并在多样化的下游自然语言理解任务(包括文本分类、问答和语义相似度)上进行微调。
  • 利用段落重排目标中的 [CLS] 标记,通过捕捉全局文档结构,提升文档级分类性能。

实验结果

研究问题

  • RQ1基于 Transformer 的模型是否能在输入序列被分割为固定长度段落的情况下,有效建模长文档而不会出现上下文碎片化?
  • RQ2如何将 Transformer 的有效上下文长度扩展至超越二次复杂度注意力和稀疏注意力机制的限制?
  • RQ3在训练过程中引入全文档上下文在多大程度上能提升下游文档级理解任务的性能?
  • RQ4基于段落重排的文档感知预训练目标是否能增强模型捕捉长距离依赖和段落间关系的能力?
  • RQ5增强循环机制是否能减少预训练阶段所需的最长序列长度,同时保持或提升模型性能?

主要发现

  • ERNIE-Doc 在 WikiText-103 基准上实现了最先进困惑度 16.8,优于此前所有自回归语言建模模型。
  • 在 TQA 和 HYP 英文问答任务上,ERNIE-Doc -Small 分别取得 64.56 和 86.10 的 F1 分数,消融实验表明每个提出组件均对性能有显著贡献。
  • 段落重排目标在 HYP 数据集上带来 1.5 个百分点的性能提升,表明其在长文本分类任务中的有效性。
  • 增强循环机制使最大序列长度为 128 的 ERNIE-Doc -Small 模型达到与序列长度 512 模型相当的准确率,证明其在降低计算成本方面的高效性。
  • 在包括长文本分类和机器阅读理解在内的七个中文自然语言理解任务中,ERNIE-Doc 在基础尺寸模型组中显著优于此前模型。
  • 消融实验确认,若移除任意关键组件(回顾性前馈、增强循环或段落重排),所有任务上的性能均出现一致且显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。