[论文解读] Multi-task learning to improve natural language understanding
本文提出一种多任务学习方法,通过在领域内合成数据与电影和电视字幕等域外真实数据上联合训练,提升自然语言理解性能。通过在基于注意力机制的序列到序列模型中共享编码器,该方法在小型合成航空旅行数据集上的F1分数从80.76%提升至84.98%,展示了无需微调即可实现更好的泛化能力。
Recently advancements in sequence-to-sequence neural network architectures have led to an improved natural language understanding. When building a neural network-based Natural Language Understanding component, one main challenge is to collect enough training data. The generation of a synthetic dataset is an inexpensive and quick way to collect data. Since this data often has less variety than real natural language, neural networks often have problems to generalize to unseen utterances during testing. In this work, we address this challenge by using multi-task learning. We train out-of-domain real data alongside in-domain synthetic data to improve natural language understanding. We evaluate this approach in the domain of airline travel information with two synthetic datasets. As out-of-domain real data, we test two datasets based on the subtitles of movies and series. By using an attention-based encoder-decoder model, we were able to improve the F1-score over strong baselines from 80.76 % to 84.98 % in the smaller synthetic dataset.
研究动机与目标
- 解决低资源领域(如航空旅行)自然语言理解(NLU)任务中领域内训练数据有限的挑战。
- 提升在合成数据集上训练的神经网络NLU模型的泛化能力,此类数据集通常缺乏语言多样性。
- 评估在与领域内合成数据联合训练时,域外真实数据(如电影字幕)是否能提升性能。
- 研究在序列到序列模型中,共享编码器的多任务学习在NLU任务中的有效性。
- 评估在使用域外真实数据进行多任务训练后,微调是否能进一步提升性能。
提出的方法
- 使用基于注意力机制的编码器-解码器模型,对领域内合成数据和域外真实数据(OpenSubtitles QA和对话数据集)共享嵌入层和编码器层。
- 通过在多个小批量组上累积梯度来稳定训练过程,避免优化过程中困惑度飙升。
- 采用Adam优化器,并采用每小批量组处理一个任务的训练调度策略,但将梯度在t组内累积,每t步更新一次权重。
- 先训练多任务模型,然后使用相同的训练数据在领域内任务上进行微调。
- 使用ATIS基准测试集的F1分数和意图准确率评估性能,并与单任务基线模型进行比较。
- 使用两个合成数据集(ATIS small和medium)和两个域外数据集(OpenSubtitles QA和对话)进行评估。
实验结果
研究问题
- RQ1在自然语言理解任务中,联合训练领域内合成数据与域外真实数据是否能提升F1分数?
- RQ2在多任务序列到序列模型中,仅共享编码器层是否比完全参数共享或不共享参数具有更好的泛化性能?
- RQ3当仅使用合成数据时,多任务学习与单任务学习相比表现如何?
- RQ4在多任务训练后进行微调是否能进一步提升领域内NLU任务的性能?
- RQ5噪声较大或结构不匹配的域外数据(如QA与对话)是否仍能为领域内NLU提供有用的归纳偏置?
主要发现
- 在ATIS small合成数据集上,多任务学习方法将F1分数从80.76%提升至84.98%,较单任务基线模型提升4.22个百分点。
- 在更大的ATIS medium数据集上,使用OpenSubtitles对话数据集的多任务模型取得了93.27%的F1分数,仅比在真实ATIS数据上训练的单任务模型(93.62%)低0.35分。
- 表现最佳的多任务模型(使用OpenSubtitles对话数据)在ATIS small数据集上的测试F1分数达到84.98%,比单任务基线模型高出4.22个百分点。
- 在多任务训练后进行微调对F1分数的提升可忽略不计,表明多任务模型已具备强大性能,无需进一步调优。
- 使用OpenSubtitles QA数据训练的模型在ATIS small数据集上的测试F1分数达到83.08%,较基线模型提升2.32个百分点。
- 意图准确率也显著提升,在ATIS small数据集上使用OpenSubtitles对话数据进行多任务学习时,准确率提升了1.79个百分点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。