Skip to main content
QUICK REVIEW

[论文解读] Understanding How Encoder-Decoder Architectures Attend

Kyle Aitken, Vinay Ramasesh|arXiv (Cornell University)|Oct 28, 2021
EEG and Brain-Computer Interfaces参考文献 23被引用 6
一句话总结

本文将编码器-解码器隐藏状态分解为时间(与序列位置无关)和输入驱动(与输入相关)两部分,以解释注意力矩阵的形成机制。作者发现,无论架构如何,当注意力矩阵接近共享平均值时,网络更依赖于时间分量——揭示了循环与前馈模型之间尽管动态机制不同,却存在统一的注意力机制。

ABSTRACT

Encoder-decoder networks with attention have proven to be a powerful way to solve many sequence-to-sequence tasks. In these networks, attention aligns encoder and decoder states and is often used for visualizing network behavior. However, the mechanisms used by networks to generate appropriate attention matrices are still mysterious. Moreover, how these mechanisms vary depending on the particular architecture used for the encoder and decoder (recurrent, feed-forward, etc.) are also not well understood. In this work, we investigate how encoder-decoder networks solve different sequence-to-sequence tasks. We introduce a way of decomposing hidden states over a sequence into temporal (independent of input) and input-driven (independent of sequence position) components. This reveals how attention matrices are formed: depending on the task requirements, networks rely more heavily on either the temporal or input-driven components. These findings hold across both recurrent and feed-forward architectures despite their differences in forming the temporal components. Overall, our results provide new insight into the inner workings of attention-based encoder-decoder networks.

研究动机与目标

  • 理解编码器-解码器网络中注意力矩阵形成的机制,特别是不同架构之间的差异。
  • 研究隐藏状态的时间分量与输入驱动分量在序列到序列任务中对注意力行为的贡献。
  • 确定尽管结构不同,循环与前馈架构之间的注意力动态是否存在显著差异。
  • 开发一种分解方法,以分离输入驱动与时间动态,提升注意力机制的可解释性。

提出的方法

  • 作者将编码器和解码器的隐藏状态分解为两个正交分量:一个依赖于输入序列(输入驱动),另一个与输入无关(时间)。
  • 他们使用线性投影将隐藏状态向量分解为时间分量与输入驱动分量之和,从而实现动态的解耦。
  • 该分解方法应用于三种架构:AED(基于注意力的编码器-解码器)、VED(普通编码器-解码器)以及带注意力的循环变体。
  • 他们分析了每个分量在注意力矩阵形成中的贡献,尤其关注对角线注意力矩阵及样本相关变化的场景。
  • 他们评估了读出向量与输入分量及时间动态的一致性,特别是在模型输出逻辑差异中的贡献。
  • 他们使用合成任务和可视化技术(包括主成分分析)追踪隐藏状态轨迹,并评估聚类行为。

实验结果

研究问题

  • RQ1隐藏状态的时间分量与输入驱动分量在编码器-解码器模型中如何共同作用于注意力矩阵的形成?
  • RQ2这些分量在不同架构(如循环与前馈)之间有多大差异?
  • RQ3为何在某些任务中网络形成的注意力矩阵接近共享平均矩阵,其驱动因素是什么,样本特异性偏差又由何引起?
  • RQ4在基于注意力的模型中,解码器读出与上下文向量读出的动力学如何相互作用?
  • RQ5隐藏状态空间中会浮现何种结构模式(如树状组织),它们与注意力机制和序列生成有何关联?

主要发现

  • 当平均注意力矩阵能较好地近似单个样本的注意力矩阵时,隐藏状态的时间分量在注意力矩阵形成中起主导作用。
  • 当注意力矩阵显著偏离平均值时,输入驱动分量变得更具影响力,表明存在任务特定的对齐机制。
  • 尽管时间分量的形成动态存在差异,但循环与前馈架构均通过相似的分量交互生成注意力,暗示存在共享的底层机制。
  • 在AED模型中,上下文向量读出与输入分量高度对齐,且对逻辑差异的贡献远超解码器隐藏状态读出(后者几乎正交且贡献均匀)。
  • 在VED模型中,编码器隐藏状态在隐藏空间中形成树状结构,不同输入短语对应不同路径,但解码器中未观察到镜像树状结构,表明学习动态存在差异。
  • AED模型中解码器读出与上下文向量读出几乎正交,且对逻辑差异的贡献极小,证实上下文向量是输出预测的主要驱动力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。