[论文解读] Disentangled Sequence to Sequence Learning for Compositional Generalization
本文提出 Dangle,一种序列到序列模型的扩展方法,通过在每个解码步骤中基于当前目标上下文自适应地重新编码源输入,提升组合泛化能力。该机制减少了表征纠缠,使模型在语义解析和机器翻译任务中对未见过的组合形式具有更好的泛化能力,在 COGS、CFQ 和 CoGnition 基准测试中优于强基线模型。
There is mounting evidence that existing neural network models, in particular the very popular sequence-to-sequence architecture, struggle to systematically generalize to unseen compositions of seen components. We demonstrate that one of the reasons hindering compositional generalization relates to representations being entangled. We propose an extension to sequence-to-sequence models which encourages disentanglement by adaptively re-encoding (at each time step) the source input. Specifically, we condition the source representations on the newly decoded target context which makes it easier for the encoder to exploit specialized information for each prediction rather than capturing it all in a single forward pass. Experimental results on semantic parsing and machine translation empirically show that our proposal delivers more disentangled representations and better generalization.
研究动机与目标
- 解决标准序列到序列模型在组合泛化方面的失败问题,特别是其在面对已知组件的未见过组合时的困难。
- 识别表征纠缠(即隐藏状态中语义因素如语义和关系相互依赖)是导致泛化能力差的关键原因。
- 开发一种方法,通过在解码过程中根据当前目标上下文动态调整源编码,实现解耦表征。
- 证明该方法可在无需任务特定修改或解耦显式监督的情况下,提升零样本泛化能力。
- 在多个基准测试(包括 COGS、CFQ 和 CoGnition)上验证该方法的鲁棒性与泛化能力。
提出的方法
- 引入一种自适应重新编码机制,在每个解码时间步重新编码源输入,条件依赖于解码器的当前隐藏状态。
- 将源表示条件化于新生成的目标上下文,使编码器能够聚焦于当前预测相关的语义因素。
- 通过在每个步骤将解码器状态信息注入编码器的输入表示,修改标准序列到序列架构。
- 使用上下文感知编码器,通过动态上下文条件化,为不同组件(如关系和实体)维护专门的表征。
- 使用标准序列到序列目标端到端训练模型,无需额外正则化或解耦监督。
- 将该方法应用于语义解析和机器翻译任务,展示在零样本和分布外泛化方面的持续增益。
实验结果
研究问题
- RQ1标准序列到序列模型中的表征纠缠在多大程度上阻碍了组合泛化?
- RQ2基于当前目标上下文的源输入自适应重新编码,能否带来更解耦的表征?
- RQ3这种动态重新编码机制是否能提升语义解析和机器翻译任务中对未见过的组合结构的泛化能力?
- RQ4在零样本和分布外设置下,该方法与强基线及专用技术相比表现如何?
- RQ5该模型是否能在无解耦显式监督的情况下,泛化到熟悉句法和语义成分的新组合?
主要发现
- 所提出的 Dangle 模型在 COGS 基准测试中达到最先进性能,在词汇和结构泛化任务中均优于强基线模型。
- 在 CFQ 基准测试中,Dangle 在零样本泛化方面表现显著提升,尤其在复杂嵌套的组合查询上。
- 在机器翻译任务中,Dangle 在全部五个测试上下文中均正确翻译了罕见复合短语如“behind the small doctor on the floor”,而基线模型则持续失败。
- 模型减少了表征纠缠,注意力和表征分析结果表明其在关系和实体方面具有更好的解耦性。
- 自适应重新编码机制带来了更鲁棒且上下文相关的源表征,提升了泛化能力,且无需架构或数据集特定修改。
- 该方法在不同任务和领域间具有泛化能力,在语义解析、机器翻译和逻辑推理基准测试中均表现出一致的组合泛化增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。