[论文解读] Lexicon Learning for Few-Shot Neural Sequence Modeling
本文提出一种基于词典的神经序列模型,通过一种新颖的词汇翻译机制,学习与上下文无关的词元级翻译规则,从而提升少样本泛化能力。通过使用词典学习算法(尤其是基于规则的方法)初始化该机制,在语义解析、指令遵循和低资源机器翻译任务上取得当前最优结果,少样本词学习任务中最高提升达2.2 BLEU分。
Sequence-to-sequence transduction is the core problem in language processing applications as diverse as semantic parsing, machine translation, and instruction following. The neural network models that provide the dominant solution to these problems are brittle, especially in low-resource settings: they fail to generalize correctly or systematically from small datasets. Past work has shown that many failures of systematic generalization arise from neural models' inability to disentangle lexical phenomena from syntactic ones. To address this, we augment neural decoders with a lexical translation mechanism that generalizes existing copy mechanisms to incorporate learned, decontextualized, token-level translation rules. We describe how to initialize this mechanism using a variety of lexicon learning algorithms, and show that it improves systematic generalization on a diverse set of sequence modeling tasks drawn from cognitive science, formal semantics, and machine translation.
研究动机与目标
- 解决神经序列模型在低资源设置下的脆弱性,特别是其在小样本数据上系统性泛化失败的问题。
- 通过将词元级翻译规则与句法结构解耦,克服神经模型混淆词汇与句法信息的局限。
- 提升序列到序列任务(如语义解析、指令遵循和机器翻译)中的少样本学习性能。
- 研究基于信息论、对齐方法和基于规则的词典学习算法在词汇翻译机制中的有效初始化方法。
- 评估联合学习词典与解码器参数是否能显著优于固定预训练词典。
提出的方法
- 在神经序列解码器中引入词汇翻译机制,将神经复制机制推广至基于注意力的词元级翻译规则,实现端到端可微学习。
- 使用多种词典学习算法初始化词汇翻译机制:基于互信息的方法(PMI)、基于IBM Model 2的方法(IBMM2),以及一种识别高精度词对的基于规则的初始化器。
- 采用温度缩放(τ)的软注意力机制,使训练过程中对词典实现可微的软注意力计算。
- 初始化后冻结词典参数,评估固定词典与微调词典两种变体的性能。
- 将该机制应用于多种任务:COGS(语义解析)、Colors(组合泛化)和Tatoeba英中翻译(低资源机器翻译)。
- 在标准LSTM编码器-解码器框架中,将词汇机制添加至输出层,通过学习到的词元映射生成翻译。
实验结果
研究问题
- RQ1学习到的、去上下文化的词元级翻译规则词典是否能提升少样本神经序列建模中的系统性泛化能力?
- RQ2在信息论、对齐方法和基于规则的词典学习算法中,哪一种能为词汇翻译机制提供最佳初始化?
- RQ3联合学习词典与解码器参数是否能带来显著性能提升,优于固定预初始化的词典?
- RQ4所提出的机制在真实低资源机器翻译任务中效果如何,特别是在单样本词学习方面?
- RQ5模型性能在多大程度上依赖于词典初始化器的归纳偏置,尤其是在训练准确率易于达到的任务中?
主要发现
- 采用基于规则的词典初始化器的词汇翻译机制在COGS任务上达到最高报告性能(0.83 F1),在Colors任务上测试集准确率达100%,优于基线模型。
- 在Tatoeba英中翻译任务中,模型在全测试集上BLEU提升1.2分,在单样本示例(训练中仅出现一次的词)上提升达2.2分。
- 基于规则的初始化器在所有任务中均匹配或优于PMI和IBMM2方法,表明高精度词对比统计估计更具有效性。
- 在训练过程中微调词典仅带来微小收益(COGS上提升≤1%),表明离线词典初始化至关重要且已足够。
- 模型在Colors数据集上达到100%准确率,该数据集是组合泛化能力的基准,表明其对罕见及未见句法结构具有强鲁棒性。
- 该方法不仅适用于合成任务,还在真实低资源机器翻译中表现强劲,尤其在稀有词的快速映射方面表现出色。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。