[论文解读] Generative Language Models for Paragraph-Level Question Generation
本文提出了 QG-Bench,一个用于段落级问题生成(QG)的多语言、多领域基准,将现有问答数据集统一为标准化的评估框架。通过微调 T5 和 BART 等生成式语言模型,研究发现:在领域特定数据上微调的 SQuAD 预训练模型表现更优,其中 T5-large 在可理解性方面获得 2.95 的人工评估得分,同时揭示了零 shot 跨语言迁移的局限性,以及对 BLEU 和 ROUGE 之外更优自动评估指标的迫切需求。
Powerful generative models have led to recent progress in question generation (QG). However, it is difficult to measure advances in QG research since there are no standardized resources that allow a uniform comparison among approaches. In this paper, we introduce QG-Bench, a multilingual and multidomain benchmark for QG that unifies existing question answering datasets by converting them to a standard QG setting. It includes general-purpose datasets such as SQuAD for English, datasets from ten domains and two styles, as well as datasets in eight different languages. Using QG-Bench as a reference, we perform an extensive analysis of the capabilities of language models for the task. First, we propose robust QG baselines based on fine-tuning generative language models. Then, we complement automatic evaluation based on standard metrics with an extensive manual evaluation, which in turn sheds light on the difficulty of evaluating QG models. Finally, we analyse both the domain adaptability of these models as well as the effectiveness of multilingual models in languages other than English. QG-Bench is released along with the fine-tuned models presented in the paper https://github.com/asahi417/lm-question-generation, which are also available as a demo https://autoqg.net/.
研究动机与目标
- 为解决在不同领域和语言之间评估段落级问题生成(QG)模型时缺乏标准化基准的问题。
- 将多样化的问答数据集统一为单一、一致的 QG 基准,以实现公平比较。
- 使用自动与人工评估方法,评估最先进生成式语言模型(如 T5、BART)在 QG 任务上的表现。
- 探究 QG 模型在领域适应性与零 shot 跨语言迁移方面的能力。
- 分析自动评估指标(BLEU、METEOR、ROUGE)与人工判断的相关性,尤其关注可回答性方面。
提出的方法
- 通过将现有问答数据集转换为标准化 QG 格式,构建 QG-Bench,包括 SQuAD、10 个领域特定数据集和 8 个语言特定数据集。
- 在 QG-Bench 数据上微调序列到序列生成式语言模型(如 T5、BART、BART-large),将 QG 视为文本到文本的生成任务。
- 使用标准自动评估指标(BLEU4、METEOR、ROUGE-L)进行评估,并开展广泛的人工评估,涵盖可回答性、语法正确性与可理解性。
- 通过消融研究比较三种微调设置:仅领域内微调、从 SQuAD 进行零 shot 迁移、以及先用 SQuAD 初始化再进行领域微调。
- 通过将英语训练的模型应用于低资源语言,评估零 shot 跨语言迁移性能,并分析性能差距。
- 使用人工标注得分作为代理指标,评估自动评估指标的可靠性,发现 METEOR 在可回答性方面与人工判断相关性最高。
实验结果
研究问题
- RQ1在段落级 QG 任务中,不同自动评估指标(BLEU、METEOR、ROUGE)与人工判断的相关性如何?
- RQ2在低资源或领域特定设置中,SQuAD 预训练对提升 QG 性能有何影响?
- RQ3仅在英语数据上训练的 QG 模型,在零 shot 跨语言迁移方面效果如何?
- RQ4生成式语言模型在段落级 QG 中对多样化领域和语言风格的适应能力如何?
- RQ5当前自动评估指标在捕捉生成问题的可回答性与语义正确性方面存在哪些局限?
主要发现
- T5-large 在 SQuAD 数据集上获得 2.95 的最高人工评估可理解性得分,表明其在生成流畅且连贯问题方面表现优异。
- 在 SQuAD 预训练基础上,再对领域特定数据进行微调,显著优于仅领域内微调和零 shot 迁移设置,尤其在问题风格差异显著的领域(如 SubjQA)中表现突出。
- METEOR 在可回答性方面与人工判断的相关性最高,优于 BLEU4 和 ROUGE-L,表明其作为 QG 评估指标更具可靠性。
- 零 shot 跨语言迁移至其他语言时性能有限,表明多语言 QG 通用化能力仍有显著提升空间。
- 研究证实,当前自动评估指标常无法准确捕捉可回答性,凸显了在 QG 研究中亟需更优的评估协议。
- SQuAD 预训练模型在进一步微调领域特定数据后表现出强大的领域适应能力,但在零 shot 迁移方面表现较弱,尤其在风格差异较大的领域中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。