Skip to main content
QUICK REVIEW

[论文解读] Pay Better Attention to Attention: Head Selection in Multilingual and Multi-Domain Sequence Modeling

Hongyu Gong, Yun Tang|arXiv (Cornell University)|Jun 21, 2021
Topic Modeling参考文献 35被引用 5
一句话总结

本文提出自适应注意力头选择策略——子集策略与分组策略,通过在多头注意力中实现选择性参数共享,提升多语言和多领域序列建模性能。通过学习在不同语言或领域间共享哪些注意力头,该方法在减少干扰的同时保留了专业化能力,在自动语音识别、文本到文本及语音到文本翻译任务中均取得一致性能提升,多语言语音到文本翻译任务中最高达+2.0 BLEU的提升。

ABSTRACT

Multi-head attention has each of the attention heads collect salient information from different parts of an input sequence, making it a powerful mechanism for sequence modeling. Multilingual and multi-domain learning are common scenarios for sequence modeling, where the key challenge is to maximize positive transfer and mitigate negative transfer across languages and domains. In this paper, we find that non-selective attention sharing is sub-optimal for achieving good generalization across all languages and domains. We further propose attention sharing strategies to facilitate parameter sharing and specialization in multilingual and multi-domain sequence modeling. Our approach automatically learns shared and specialized attention heads for different languages and domains to mitigate their interference. Evaluated in various tasks including speech recognition, text-to-text and speech-to-text translation, the proposed attention sharing strategies consistently bring gains to sequence models built upon multi-head attention. For speech-to-text translation, our approach yields an average of $+2.0$ BLEU over $13$ language directions in multilingual setting and $+2.0$ BLEU over $3$ domains in multi-domain setting.

研究动机与目标

  • 解决多语言和多领域序列建模中因多头注意力内非选择性参数共享导致的干扰问题。
  • 通过实现动态、数据驱动的共享注意力头选择,提升在多样化语言和领域间的泛化能力与知识迁移能力。
  • 通过轻量、高效的注意力头共享策略,减轻负迁移影响,同时保留语言和领域特异性。
  • 在多种序列建模任务(包括自动语音识别、文本到文本、语音到文本翻译)上评估所提方法。
  • 在低资源与高资源设置下均实现一致的性能提升,且不牺牲计算效率。

提出的方法

  • 提出两种注意力头选择策略:子集策略与分组策略,以控制在不同语言或领域间共享哪些注意力头。
  • 在基于Transformer的模型编码器和解码器中,于层级别应用这些策略,实现每层对共享或专用注意力头的选择。
  • 采用可学习门控机制确定每个语言或领域对应的活跃注意力头,实现在训练过程中的动态自适应。
  • 设计选择过程为轻量化,避免显著的计算开销,同时保持与标准多头注意力的兼容性。
  • 使用标准反向传播训练同时包含共享与专用注意力头的模型,注意力头选择通过端到端方式联合学习。
  • 可视化注意力头负载分布,以分析共享模式及在不同语言和模型层之间的分布均衡性。

实验结果

研究问题

  • RQ1选择性注意力头共享在多语言和多领域序列建模中的性能影响如何?
  • RQ2注意力头选择策略能否在减少不同语言或领域间干扰的同时,仍保留知识迁移能力?
  • RQ3在编码器与解码器中分别应用注意力选择对模型性能的影响有何差异?
  • RQ4在高资源与低资源语言中,共享模式(如共享头的数量)如何变化?
  • RQ5在不同选择策略下,注意力头的负载分布是否均衡?

主要发现

  • 所提出的注意力头选择策略在多个序列建模任务中均一致提升性能,包括多语言语音识别与语音到文本翻译。
  • 在多语言语音到文本翻译任务中,该方法在13个语言方向上平均提升+2.0 BLEU,展现出强大的正向迁移能力。
  • 在多领域语音到文本翻译任务中,该方法在3个领域上实现+2.0 BLEU的性能提升,证实其在领域泛化方面的有效性。
  • 在编码器与解码器中均应用注意力选择的性能优于仅在单一模块中应用,且在多语言自动语音识别任务中,仅使用编码器的选择优于仅使用解码器的选择。
  • 高资源欧洲语言(如意大利语、法语)因数据充足,共享的注意力头更少,从而减少干扰;而低资源语言则从与高资源语言共享中获益。
  • 与子集策略相比,分组策略在编码器和解码器的中间层产生更均衡的注意力头负载分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。