[论文解读] Multi-domain Neural Network Language Generation for Spoken Dialogue Systems
本文提出了一种用于语音对话系统的多领域神经网络语言生成框架,通过数据伪造和判别式训练实现高效的领域自适应。首先在域外数据集生成的合成数据上进行预训练,随后使用少量目标域数据通过判别式目标进行微调,该方法在降低数据需求的同时实现了具有竞争力的BLEU分数和槽位错误率,人类评估也证实即使仅使用10%的目标域数据,生成结果的自然度和信息量也得到提升。
Moving from limited-domain natural language generation (NLG) to open domain is difficult because the number of semantic input combinations grows exponentially with the number of domains. Therefore, it is important to leverage existing resources and exploit similarities between domains to facilitate domain adaptation. In this paper, we propose a procedure to train multi-domain, Recurrent Neural Network-based (RNN) language generators via multiple adaptation steps. In this procedure, a model is first trained on counterfeited data synthesised from an out-of-domain dataset, and then fine tuned on a small set of in-domain utterances with a discriminative objective function. Corpus-based evaluation results show that the proposed procedure can achieve competitive performance in terms of BLEU score and slot error rate while significantly reducing the data needed to train generators in new, unseen domains. In subjective testing, human judges confirm that the procedure greatly improves generator performance when only a small amount of data is available in the domain.
研究动机与目标
- 解决在训练新型、未见对话领域神经语言生成器时面临的数据稀缺问题。
- 降低对大规模标注目标域数据的依赖,以训练高效的语言生成器。
- 通过两阶段训练流程提升低资源领域自适应场景下的泛化能力与性能。
- 通过自动指标与人工评估相结合的方式,评估所提方法的有效性。
提出的方法
- 通过将域外语言模型应用于生成目标域对话行为的语句,合成伪造的训练数据。
- 在合成的伪造数据上预训练基于序列到序列的RNN语言生成器,以建立一个与领域无关的基础模型。
- 使用小规模真实目标域数据集,通过判别式训练目标(如BLEU)对预训练模型进行微调。
- 使用直接优化目标函数优化生成器,以直接最大化BLEU等期望评估指标并最小化槽位错误率。
- 在多个领域(如笔记本电脑、电视、餐厅、酒店)应用相同的自适应方法,以证明其泛化能力。
- 通过人工评估(AMT-based)评估生成结果的自然度、信息量以及不同数据与训练策略下系统间的成对偏好。
实验结果
研究问题
- RQ1在域外数据集生成的合成数据上预训练的神经语言生成器,能否有效泛化到新的、低资源的目标领域?
- RQ2当仅能获得少量目标域数据时,判别式微调与标准最大似然训练相比表现如何?
- RQ3所提出的两阶段自适应流程是否能同时提升自动指标(BLEU、槽位错误率)与人工评分质量(自然度、信息量)?
- RQ4当仅使用10%的目标域数据时,该方法能否实现与全量数据训练相当的性能?
- RQ5在低资源设置下,人类评判者是否更偏好判别式训练方法而非最大似然训练?
主要发现
- 即使将训练数据减少至全量目标域数据集的10%,所提方法仍实现了具有竞争力的BLEU分数与槽位错误率,显著优于仅用有限数据从零开始训练的基线模型。
- 当仅使用10%的目标域数据时,人类评判者认为判别式微调模型(DT-10%)在自然度与信息量方面显著优于最大似然训练模型(ML-10%)。
- 在从笔记本电脑领域迁移到电视领域的场景中,DT-10%模型的信息量得分与全量数据基线(scrALL)无显著差异,表明在数据稀缺条件下仍能生成高质量输出。
- 偏好测试显示,DT-10%在55.1%的比较中优于ML-10%(p < 0.005),在66.1%的比较中优于仅用10%数据从零开始训练的模型(p < 0.005),证实人类更偏好判别式训练方法。
- 该方法显著降低了有效领域自适应所需的数据量,同时保持了高性能,该结论得到自动评估与主观评估的双重验证。
- 该自适应方法在四个不同对话领域中均表现出色,证明了其良好的泛化能力与对领域分布变化的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。