[论文解读] Multi-Task Learning with Language Modeling for Question Generation
本文提出了一种分层多任务学习框架,将语言建模作为辅助任务以提升答案感知型问题生成的质量。通过联合训练指针-生成模型与语言建模,编码器学习到更丰富的上下文表征,从而生成更流畅、更连贯的问题;该方法在SQuAD和MARCO数据集上均取得了最先进性能,BLEU-4得分分别为16.23和20.88,且经人工评估验证。
This paper explores the task of answer-aware questions generation. Based on the attention-based pointer generator model, we propose to incorporate an auxiliary task of language modeling to help question generation in a hierarchical multi-task learning structure. Our joint-learning model enables the encoder to learn a better representation of the input sequence, which will guide the decoder to generate more coherent and fluent questions. On both SQuAD and MARCO datasets, our multi-task learning model boosts the performance, achieving state-of-the-art results. Moreover, human evaluation further proves the high quality of our generated questions.
研究动机与目标
- 通过利用多任务学习提升答案感知型问题生成的质量。
- 解决现有神经网络问题生成模型在流畅性与连贯性方面的局限性。
- 探究将语言建模作为辅助任务是否能增强问题生成中的表征学习。
- 评估模型在不同数据集和特征设置下的鲁棒性与泛化能力。
提出的方法
- 该模型采用分层多任务学习结构,其中语言建模作为与问题生成并行的辅助任务。
- 编码器采用双向LSTM,输入包括词嵌入、答案位置嵌入以及词性标注(POS)、命名实体识别(NER)和大小写等词汇特征。
- 解码器采用基于注意力机制的指针-生成网络,结合强化学习与词汇特征以生成问题。
- 语言建模任务旨在预测输入序列中的下一个和前一个词,从而丰富编码器的表征。
- 联合模型在两个任务间共享编码器,实现从语言建模到问题生成的知识迁移。
- 模型采用两种损失函数的加权组合进行端到端训练:问题生成损失与语言建模损失。
实验结果
研究问题
- RQ1将语言建模作为辅助任务是否能提升答案感知型问题生成中生成问题的质量?
- RQ2语言建模与问题生成的联合学习如何影响问题的流畅性、相关性与语法正确性?
- RQ3所提出的方法在不同数据集上是否具备泛化能力,且在缺乏词汇特征时是否依然有效?
- RQ4辅助语言建模任务在多大程度上增强了编码器的表征学习能力?
主要发现
- 所提出的多任务学习模型在SQuAD数据集上取得16.23的BLEU-4得分,在MARCO数据集上取得20.88的BLEU-4得分,优于所有先前的最先进方法。
- 在SQuAD上,加入语言建模与特征的模型相比基线模型,BLEU-4得分提升1.34;在MARCO上提升1.73。
- 即使在无词汇特征的情况下,语言建模辅助任务仍能提升性能,表明模型具备鲁棒性与泛化能力。
- 人工评估显示显著提升:SQuAD上匹配度(1.147 vs. 0.983)、流畅度(1.690 vs. 1.573)与相关性(1.600 vs. 1.540)得分均提高,MARCO上亦呈现类似改善。
- 困惑度与唯一词项分数证实,语言建模提升了生成问题的流畅性与多样性。
- 消融实验表明,性能提升源于多任务学习机制,而非简单增加额外编码器层;仅加深网络结构并不会带来性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。