Skip to main content
QUICK REVIEW

[论文解读] Information Aggregation for Multi-Head Attention with Routing-by-Agreement

Jian Li, Baosong Yang|arXiv (Cornell University)|Apr 5, 2019
Topic Modeling参考文献 29被引用 12
一句话总结

本文提出一种基于共识的路由机制,以改进多头注意力中的信息聚合,用迭代注意力路由替代标准的线性拼接,根据共识将各部分(注意力头)分配给整体(最终表示)。实验表明,在语言探针和机器翻译任务中均取得一致性能提升,参数量减少25%后性能仍可与更大模型比肩。

ABSTRACT

Multi-head attention is appealing for its ability to jointly extract different types of information from multiple representation subspaces. Concerning the information aggregation, a common practice is to use a concatenation followed by a linear transformation, which may not fully exploit the expressiveness of multi-head attention. In this work, we propose to improve the information aggregation for multi-head attention with a more powerful routing-by-agreement algorithm. Specifically, the routing algorithm iteratively updates the proportion of how much a part (i.e. the distinct information learned from a specific subspace) should be assigned to a whole (i.e. the final output representation), based on the agreement between parts and wholes. Experimental results on linguistic probing tasks and machine translation tasks prove the superiority of the advanced information aggregation over the standard linear transformation.

研究动机与目标

  • 探究标准线性变换在多头注意力聚合中是否足以捕捉丰富的表征信息。
  • 探索超越线性变换的先进聚合机制——特别是基于共识的路由机制——在多头注意力中的应用。
  • 评估基于路由的聚合机制在语言探针和机器翻译任务中的有效性。
  • 识别一种在性能与计算成本之间实现平衡的高效配置,尤其关注训练与推理速度。

提出的方法

  • 该方法将多头注意力输出视为'部分',最终表示视为'整体',将聚合问题建模为从部分到整体的分配问题。
  • 采用EM路由算法,基于部分(注意力头)与整体(最终输出表示)之间的共识,迭代更新路由权重。
  • 路由过程采用动态路由机制,利用基于注意力的共识得分,确定每个头的输出对最终表示的贡献程度。
  • 该方法选择性地应用于Transformer模型编码器的低层两层,以在效率与性能之间取得平衡。
  • 路由机制取代了多头注意力中的标准线性变换,在保持模型架构不变的同时增强了表征的表达能力。
  • 该方法在语言探针任务和机器翻译基准(WMT14 En→De 和 WMT17 Zh→En)上进行了评估。

实验结果

研究问题

  • RQ1标准线性变换在聚合多头注意力输出时,是否足以捕捉不同注意力头的全部表达能力?
  • RQ2基于共识的路由机制能否提升多头注意力在NLP任务中学习到的表征质量?
  • RQ3基于路由的聚合机制对不同模型配置下的翻译性能和训练效率有何影响?
  • RQ4在何种层深位置应用基于路由的聚合,才能在性能与计算成本之间实现最佳平衡?

主要发现

  • 基于共识的路由机制在10项语言探针任务中显著提升性能,表明聚合后的表征捕捉到了更多的句法与语义信息。
  • 在WMT14 En→De和WMT17 Zh→En翻译任务中,所提方法在Transformer-Base和Transformer-Big模型上均持续优于标准Transformer基线。
  • 仅对编码器低层两层应用路由机制,可实现良好权衡,使训练时间减少37.5%的同时保持高性能。
  • 采用有效聚合机制的Transformer-Base模型,尽管参数量约为Transformer-Big模型的三分之二,但性能可与之比肩。
  • 在所有层或多个组件(如编码器与解码器)中应用路由机制,会导致显著的速度下降,且收益不成比例,表明存在收益递减现象。
  • 实证结果表明,该路由机制是线性聚合的有力替代方案,且在多种NLP任务中均得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。