[论文解读] Cooperative Learning of Disjoint Syntax and Semantics
该论文提出了一种协作学习框架,将句法和语义分离为独立模块,通过混合连续(梯度下降)和离散(强化学习)优化方式进行训练。该模型在从上下文无关语法解析嵌套数学表达式时达到接近完美的准确率,并在无需显式句法监督的情况下,在自然语言蕴涵(NLI)和情感分析任务上表现具有竞争力。
There has been considerable attention devoted to models that learn to jointly infer an expression's syntactic structure and its semantics. Yet, \citet{NangiaB18} has recently shown that the current best systems fail to learn the correct parsing strategy on mathematical expressions generated from a simple context-free grammar. In this work, we present a recursive model inspired by ewcite{ChoiYL18} that reaches near perfect accuracy on this task. Our model is composed of two separated modules for syntax and semantics. They are cooperatively trained with standard continuous and discrete optimization schemes. Our model does not require any linguistic structure for supervision and its recursive nature allows for out-of-domain generalization with little loss in performance. Additionally, our approach performs competitively on several natural language tasks, such as Natural Language Inference or Sentiment Analysis.
研究动机与目标
- 解决现有模型在无监督情况下从简单上下文无关语法规则中学习正确句法结构的局限性。
- 克服离散解析器与连续组合函数在联合训练中的共适应问题。
- 通过递归的、端到端可训练的架构与分离模块,实现分布外泛化能力。
- 在自然语言蕴涵(NLI)和情感分析等标准NLP任务上展示具有竞争力的性能,同时学习有意义的句法结构。
- 探索使用具有潜在树结构的递归模型作为下游任务预训练方法的可行性。
提出的方法
- 将模型分解为两个独立模块:离散解析器(树结构生成器)和连续组合函数(语义表示学习器)。
- 使用近端策略优化(PPO)进行强化学习训练,以稳定训练过程并控制学习速率。
- 采用输入相关的控制变量,以降低强化学习目标中的梯度方差。
- 在每次策略更新中应用多个梯度步骤,以提高样本效率和策略学习效果。
- 将组合函数的梯度下降与解析器的强化学习相结合,通过同步学习率来避免共适应问题。
- 使用Tree-LSTM作为组合函数,通过结构反向传播(BPTS)实现可微分,从而从解析树生成语义表示。
实验结果
研究问题
- RQ1一个联合训练的、端到端的模型是否能在无显式解析监督的情况下,从简单上下文无关语法规则中学习到正确的句法结构?
- RQ2如何在不导致一方主导另一方的情况下,协同训练离散(解析器)与连续(组合函数)组件?
- RQ3分离句法与语义是否能提升对分布外序列(如更长或未见的数学表达式)的泛化能力?
- RQ4学习潜在句法结构在多大程度上能提升下游NLP任务(如NLI和情感分析)的性能?
- RQ5当在自然语言数据上训练时,该模型是否会避免退化为平凡的解析策略(如左分支树)?
主要发现
- 在MultiNLI基准上,该模型达到70.7% ± 0.3的准确率,优于先前的无监督潜在树模型,并与最先进结果相当。
- 在SST-2和SST-5情感分析任务上,该模型分别取得90.2% ± 0.2和51.5% ± 0.4的准确率,与基于RvNN的潜在树模型相当或更优。
- 在ListOps任务上,该模型达到接近完美的准确率(99.8%),能够正确解析来自上下文无关语法的嵌套数学表达式。
- 解析器在无监督条件下学习到平衡且有意义的句法结构,表现为解析策略的熵值较高,并能泛化到更长序列。
- 使用PPO结合多步梯度更新与控制变量,成功缓解了共适应问题,防止了解析器简单模仿组合函数的行为。
- 尽管在形式语法规则任务上表现强劲,但在自然语言任务上,模型仍倾向于退化为平凡的解析策略,与先前研究结果一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。