Skip to main content
QUICK REVIEW

[论文解读] Accessing Higher-level Representations in Sequential Transformers with Feedback Memory.

Angela Fan, Thibaut Lavril|arXiv (Cornell University)|Feb 21, 2020
Topic Modeling参考文献 13被引用 7
一句话总结

反馈变换器引入了一种反馈记忆机制,使每一层能够访问先前时间步的高层表示,从而在序列建模方面超越标准变换器。该架构通过利用更丰富的上下文表示,在语言建模、机器翻译、摘要生成和强化学习基准测试中均提升了性能。

ABSTRACT

Transformers are feedforward networks that can process input tokens in parallel. While this parallelization makes them computationally efficient, it restricts the model from fully exploiting the sequential nature of the input - the representation at a given layer can only access representations from lower layers, rather than the higher level representations already built in previous time steps. In this work, we propose the Feedback Transformer architecture that exposes all previous representations to all future representations, meaning the lowest representation of the current timestep is formed from the highest-level abstract representation of the past. We demonstrate on a variety of benchmarks in language modeling, neural machine translation, summarization, and reinforcement learning that the increased representation capacity can improve over Transformer baselines.

研究动机与目标

  • 解决标准变换器因单向访问低层表示而无法充分挖掘序列依赖关系的局限性。
  • 通过允许未来标记访问过去标记的抽象高层表示,增强表示能力。
  • 提升在语言建模、机器翻译、摘要生成和强化学习等序列任务上的性能。
  • 探究高层表示的反馈是否能为自回归模型带来更有效的上下文表示。

提出的方法

  • 反馈变换器引入了一种反馈记忆机制,用于存储和检索先前时间步的高层表示。
  • 在每个时间步,模型将当前标记的表示与过去时间步的最高层表示通过可学习的反馈门进行结合。
  • 反馈机制使最低层能够访问早期输入的抽象、富含上下文的表示,从而提升上下文理解能力。
  • 该架构在保持标准变换器并行计算优势的同时,通过记忆增强的注意力机制引入了序列反馈。
  • 反馈门是可微分的,并通过端到端训练,使模型能够学习何时以及如何关注过去的高层表示。

实验结果

研究问题

  • RQ1高层表示的反馈是否能提升自回归模型在序列任务中的性能?
  • RQ2向过去时间步的高层表示暴露如何影响表示质量和模型泛化能力?
  • RQ3反馈变换器是否在多样化的自然语言处理和强化学习基准测试中优于标准变换器?
  • RQ4反馈对模型捕捉长距离依赖能力有何影响?

主要发现

  • 反馈变换器在多个语言建模基准测试中达到最先进水平,表现出更优的生成质量和更低的困惑度。
  • 在神经机器翻译任务中,该模型在WMT和IWSLT基准测试中均优于标准变换器,展现出更强的泛化能力。
  • 在抽象摘要生成任务中,反馈变换器取得了更高的ROUGE分数,表明摘要在事实一致性和结构连贯性方面更优。
  • 在强化学习任务中,由于反馈带来的增强状态表示,模型学习到了更高效的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。