[论文解读] Assessing the Ability of Self-Attention Networks to Learn Word Order
本文提出了一项新颖的词语重排检测(WRD)任务,以实证评估自注意力网络(SAN)、循环神经网络(RNN)以及方向性自注意力网络(DiSAN)在学习词语顺序信息方面的表现。尽管SAN缺乏循环结构,但在机器翻译任务上进行训练时,其在词语重排检测任务上的表现仍优于RNN和DiSAN,表明在实际应用中,学习目标的影响大于网络架构本身。
Self-attention networks (SAN) have attracted a lot of interests due to their high parallelization and strong performance on a variety of NLP tasks, e.g. machine translation. Due to the lack of recurrence structure such as recurrent neural networks (RNN), SAN is ascribed to be weak at learning positional information of words for sequence modeling. However, neither this speculation has been empirically confirmed, nor explanations for their strong performances on machine translation tasks when "lacking positional information" have been explored. To this end, we propose a novel word reordering detection task to quantify how well the word order information learned by SAN and RNN. Specifically, we randomly move one word to another position, and examine whether a trained model can detect both the original and inserted positions. Experimental results reveal that: 1) SAN trained on word reordering detection indeed has difficulty learning the positional information even with the position embedding; and 2) SAN trained on machine translation learns better positional information than its RNN counterpart, in which position embedding plays a critical role. Although recurrence structure make the model more universally-effective on learning word order, learning objectives matter more in the downstream tasks such as machine translation.
研究动机与目标
- 通过实证方法评估自注意力网络(SAN)是否能有效学习词语顺序信息,以挑战理论观点中认为其因缺乏循环结构而能力较弱的说法。
- 探究循环结构(RNN、DiSAN)是否在学习词语顺序方面从根本上优于SAN,特别是在机器翻译等下游任务中。
- 评估位置嵌入在使SAN能够捕捉词语顺序信息方面的作用,尤其与基于循环的模型进行对比。
- 确定学习目标(如机器翻译与词语重排检测)对学习词语顺序的影响是否大于模型架构的影响。
- 理解不同架构在神经机器翻译任务中对错误词语顺序输入的鲁棒性。
提出的方法
- 提出一项新的探测任务——词语重排检测(WRD),即在句子中随机将一个词语移动到新位置,模型需检测出该词语的原始位置和插入位置。
- 设计一个指针网络头作为位置检测器,利用编码器的上下文表示预测被重排词语的原始(O)位置和插入(I)位置。
- 在两个目标上训练并评估SAN、RNN和DiSAN编码器:(1)WRD任务本身,(2)使用WMT'14英语-德语数据集的神经机器翻译(NMT)任务。
- 以预训练或随机初始化的编码器为基础,微调其在WRD任务上的表现,以隔离架构与训练目标的影响。
- 通过在NMT开发集中引入词语顺序扰动,评估模型的鲁棒性,并测量翻译质量的下降程度。
- 分析token级别的表示,探测不同架构的隐藏状态中词语顺序信息的编码效果。
实验结果
研究问题
- RQ1循环结构是否对学习词语顺序至关重要?这一结论在机器翻译等不同任务中是否成立?
- RQ2模型架构(SAN vs. RNN vs. DiSAN)是否从根本上决定了学习词语顺序的能力,还是学习目标更为关键?
- RQ3仅靠位置嵌入是否足以使SAN有效学习词语顺序信息,尤其是在与基于循环的模型对比时?
- RQ4训练目标(如WRD与NMT)如何影响模型在下游任务中检测和处理词语顺序错误的能力?
- RQ5不同架构在神经机器翻译任务中对输入词语顺序扰动的鲁棒性如何?
主要发现
- 仅在词语重排检测(WRD)任务上训练的SAN表现显著劣于RNN和DiSAN,证实SAN在缺乏强学习目标时难以有效学习词语顺序。
- 当在机器翻译目标上进行训练时,SAN在WRD任务上的表现优于RNN和DiSAN,表明学习目标使SAN能够比架构本身更有效地学习词语顺序。
- 位置嵌入在使SAN学习词语顺序方面起到关键作用,尤其是在NMT场景中,它们弥补了缺乏循环结构的不足。
- DiSAN(结合自注意力与循环结构)在学习词语顺序方面比SAN更具普适性,表明循环建模可增强模型鲁棒性。
- 基于RNN的模型在NMT中对词语顺序扰动更敏感,因为其在训练中未接触过此类噪声,导致性能下降更明显。
- 基于SAN的NMT模型对测试输入中的词语顺序噪声更具鲁棒性,因为其在训练中已学会保留异常顺序信息,从而实现更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。