[论文解读] Attention-based Vocabulary Selection for NMT Decoding
本文提出了一种新颖的方法,直接从神经机器翻译(NMT)训练过程中的注意力权重学习目标词汇候选列表,无需依赖外部工具(如短语表或词对齐工具)。通过将注意力权重累积为稀疏对齐矩阵,并为每个源词选择注意力权重最高的候选词,该方法在两个语料对上实现了高达7倍的解码加速,且翻译质量无下降,每个词仅使用100个候选词。
Neural Machine Translation (NMT) models usually use large target vocabulary sizes to capture most of the words in the target language. The vocabulary size is a big factor when decoding new sentences as the final softmax layer normalizes over all possible target words. To address this problem, it is widely common to restrict the target vocabulary with candidate lists based on the source sentence. Usually, the candidate lists are a combination of external word-to-word aligner, phrase table entries or most frequent words. In this work, we propose a simple and yet novel approach to learn candidate lists directly from the attention layer during NMT training. The candidate lists are highly optimized for the current NMT model and do not need any external computation of the candidate pool. We show significant decoding speedup compared with using the entire vocabulary, without losing any translation quality for two language pairs.
研究动机与目标
- 解决NMT解码过程中全词汇表Softmax带来的高计算开销问题。
- 消除在候选列表生成过程中对外部工具(如短语表或词对齐工具)的依赖。
- 通过从注意力机制学习模型特定的动态候选列表,提升解码效率。
- 探究基于注意力的候选选择是否能与传统方法(如基于短语表或Viterbi对齐的外部计算候选池)相媲美或超越其性能。
- 在训练过程中利用注意力衍生的对齐关系,实现动态词汇选择。
提出的方法
- 该方法将训练过程中各步的归一化注意力权重累积到一个稀疏对齐矩阵中,隐式追踪模型所学习到的源词到目标词的对齐关系。
- 对于每个源词,选择注意力权重累积值最高的前n个目标词作为候选,形成动态候选列表。
- 候选列表定期更新——每轮或每小批量——使用归一化的对齐计数,以避免概率过时。
- 在解码阶段,Softmax仅作用于这些学习到的候选词,显著减少计算时间。
- 该方法使用阈值(α_thr = 0.1)过滤弱对齐,聚焦于高置信度的注意力模式。
- 该方法在训练和推理阶段均应用,候选列表根据模型当前参数动态调整。
实验结果
研究问题
- RQ1仅使用注意力权重是否足以学习到高效且模型特定的NMT解码候选列表?
- RQ2基于注意力的候选选择是否优于或至少不逊于依赖外部工具(如短语表或词对齐)的传统方法?
- RQ3每个源词的最优候选数量是多少,才能在保持翻译质量的同时最大化解码速度?
- RQ4在训练过程中进行动态词汇选择是否能提升效率而不损害模型性能?
- RQ5注意力权重累积的阈值(α_thr)如何影响速度与准确性的权衡?
主要发现
- 所提方法相比使用全目标词汇表的解码,解码速度最高可提升7倍,且BLEU或TER分数无下降。
- 每个源词仅使用100个最优候选词时,翻译质量与全词汇表几乎完全一致,英-意翻译任务的BLEU得分为29.6。
- 该方法在性能上优于或至少不逊于依赖外部资源(如短语表或Viterbi对齐)的传统候选选择技术。
- 从注意力权重训练得到的候选列表更具适应性,且比基于静态对齐的列表更少遗漏高分词。
- 该方法在不同语料对上均表现稳健,在英-德和英-意翻译任务中均实现了稳定加速,且无性能下降。
- 在训练过程中使用基于累积注意力权重的动态词汇选择是有效的,且避免了对外部工具的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。