[论文解读] Jointly Learning Semantic Parser and Natural Language Generator via Dual Information Maximization
该论文提出双信息最大化(DIM),通过利用语义解析与自然语言生成之间的对偶性,联合训练语义解析器和自然语言生成器,采用变分下界来最大化自然语言与语义表示之间的互信息。在对话管理与代码生成数据集上的实验表明,在监督与半监督设置下,两个任务的性能均持续提升。
Semantic parsing aims to transform natural language (NL) utterances into formal meaning representations (MRs), whereas an NL generator achieves the reverse: producing a NL description for some given MRs. Despite this intrinsic connection, the two tasks are often studied separately in prior work. In this paper, we model the duality of these two tasks via a joint learning framework, and demonstrate its effectiveness of boosting the performance on both tasks. Concretely, we propose a novel method of dual information maximization (DIM) to regularize the learning process, where DIM empirically maximizes the variational lower bounds of expected joint distributions of NL and MRs. We further extend DIM to a semi-supervision setup (SemiDIM), which leverages unlabeled data of both tasks. Experiments on three datasets of dialogue management and code generation (and summarization) show that performance on both semantic parsing and NL generation can be consistently improved by DIM, in both supervised and semi-supervised setups.
研究动机与目标
- 解决尽管语义解析与自然语言生成具有内在对偶性,但两者之间缺乏联合建模的问题。
- 通过统一学习框架利用二者互补性,提升两个任务的性能。
- 开发一种正则化方法,以捕捉自然语言与语义表示之间的双重信息。
- 将监督框架扩展为半监督设置,利用来自两个任务的未标注数据。
- 在对话管理与代码生成的真实数据集上,验证联合学习的有效性。
提出的方法
- 使用自然语言(x)与语义表示(y)的联合分布建模语义解析与自然语言生成的对偶性,近似未知的真实分布 P(x,y)。
- 提出双信息最大化(DIM),以优化来自解析器 pθ(y|x) 和生成器 qϕ(x|y) 的期望联合分布的变分下界。
- 采用受Barber和Agakov(2003)以及Zhang等人(2018)启发的变分近似方法,最大化两个模型之间的双重信息。
- 将DIM作为正则化项,与两个任务的监督目标相结合,用于语义解析与自然语言生成。
- 通过在未标注数据上引入无监督学习目标,将DIM扩展为SemiDIM。
- 使用基于REINFORCE的策略梯度方法优化联合目标中的无监督组件,结合随机梯度下降。
实验结果
研究问题
- RQ1与独立训练相比,语义解析与自然语言生成的联合学习是否能提升两个任务的性能?
- RQ2双信息最大化(DIM)在捕捉解析与生成之间结构对偶性方面的有效性如何?
- RQ3通过SemiDIM引入未标注数据是否能在低资源设置下进一步提升性能?
- RQ4在联合训练框架中,监督与无监督学习信号之间的最优权衡是什么?
- RQ5在不同超参数设置下,解析器与生成器的性能增益在多大程度上呈相关性?
主要发现
- DIM在ATIS、Django和CoNaLa三个数据集上,持续提升了语义解析与自然语言生成的性能。
- 通过SemiDIM实现的半监督学习在低资源设置下取得了显著性能提升,有效利用了来自两个任务的未标注数据。
- 当控制双信息与无监督损失之间权衡的超参数 λ 落在 0.1–1.0 范围内时,可获得最优性能。
- 当 λ = 0 时性能下降,表明无监督信号对稳健的联合学习至关重要。
- 解析器与生成器性能之间观察到较高的皮尔逊相关系数(r > 0.8),表明联合框架中存在强烈的协同适应。
- 联合模型在性能上优于独立训练的先进基线模型,证明了双学习的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。