Skip to main content
QUICK REVIEW

[论文解读] Learning compositionally through attentive guidance

Dieuwke Hupkes, Anand Singh|arXiv (Cornell University)|May 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 32被引用 19
一句话总结

本文提出注意力引导(Attentive Guidance, AG),一种训练阶段的损失函数,通过引导注意力机制聚焦于输入的组合性成分,使序列到序列模型在不修改架构的情况下学习系统性、可泛化的解决方案。AG在查找表和符号重写任务中显著提升了组合泛化性能,优于容易过拟合训练模式的基线模型。

ABSTRACT

While neural network models have been successfully applied to domains that require substantial generalisation skills, recent studies have implied that they struggle when solving the task they are trained on requires inferring its underlying compositional structure. In this paper, we introduce Attentive Guidance, a mechanism to direct a sequence to sequence model equipped with attention to find more compositional solutions. We test it on two tasks, devised precisely to assess the compositional capabilities of neural models, and we show that vanilla sequence to sequence models with attention overfit the training distribution, while the guided versions come up with compositional solutions that fit the training and testing distributions almost equally well. Moreover, the learned solutions generalise even in cases where the training and testing distributions strongly diverge. In this way, we demonstrate that sequence to sequence models are capable of finding compositional solutions without requiring extra components. These results helps to disentangle the causes for the lack of systematic compositionality in neural networks, which can in turn fuel future work.

研究动机与目标

  • 解决使用梯度下降训练的标准序列到序列模型缺乏系统性组合性的问题。
  • 探究在不进行架构增强的前提下,是否可引导原始RNN中的注意力机制朝向组合性解决方案。
  • 测试辅助监督信号——注意力引导——是否能引导模型关注输入序列中有意义且可重用的子组件。
  • 评估此类引导是否能在分布偏移下实现更好的泛化性能,尤其是在长序列或未见组合中。
  • 区分神经模型中组合性表现不佳的原因是否源于注意力机制无法区分显著模式与虚假模式。

提出的方法

  • 引入一种可微分的损失项,在训练期间提供目标注意力模式,引导模型注意力聚焦于每个输出标记对应的特定有意义输入标记。
  • 将此引导信号应用于查找表任务和符号重写任务,这两项任务专门用于测试组合泛化能力。
  • 使用LSTM/GRU编码器和解码器的标准序列到序列模型,结合标准点积注意力机制,通过AG损失塑造注意力动态。
  • 在消融研究中使用Gumbel-Softmax强制注意力权重稀疏化,测试稀疏性本身是否能复现AG的优势。
  • 在更长序列和分布外测试集上评估泛化性能,以评估模型鲁棒性。
  • 使用“已知”引导(在推理期间提供完美注意力目标)测试性能上限,并评估注意力模式泛化是否为关键瓶颈。

实验结果

研究问题

  • RQ1一个简单且可微分的损失项是否能在不修改架构的前提下,引导序列到序列模型的注意力机制朝向更具组合性的解决方案?
  • RQ2当测试数据与训练数据分布不一致时,注意力引导是否能提升组合性任务上的泛化性能?
  • RQ3AG的成功是源于注意力权重的稀疏性,还是引导信号的特定结构至关重要?
  • RQ4模型在长组合上泛化失败的程度在多大程度上源于其无法学习正确的注意力模式?
  • RQ5若在推理时提供完美注意力目标,能否弥合训练与测试之间的性能差距,从而表明注意力模式学习是主要瓶颈?

主要发现

  • 未经引导的序列到序列模型在注意力机制下会过拟合训练分布,难以泛化到未见组合,尤其在分布偏移下表现更差。
  • 使用注意力引导训练的模型学习到的注意力模式在注意力热力图中清晰聚焦于相关输入组件,且在训练和测试分布间表现出稳健的泛化能力。
  • 受引导的模型在查找表和符号重写任务上均达到接近完美的性能,即使在组合长度超过训练时见过的情况下也表现优异。
  • 通过Gumbel-Softmax强制注意力稀疏化的消融实验未能复现AG的性能增益,表明特定的引导信号(而非仅稀疏性)至关重要。
  • 已知引导(在推理时提供完美注意力模式)在两项任务上均实现接近100%的准确率,即使在极长序列上也表现良好,表明注意力模式泛化是主要障碍。
  • 结果证实,当使用合适的优化目标时,标准序列到序列模型能够学习组合性解决方案;而此类模型缺乏组合性,根本原因在于注意力机制无法区分显著模式与虚假模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。